INNOQ Podcast
INNOQ Podcast
INNOQ Podcast

AI News #8

13. Juli 2026 · 39 Min.

Die Effizienz von KI-Modellen wird zur entscheidenden Kennzahl: Nicht das teuerste Modell, sondern die Anzahl der Tokens pro Aufgabe bestimmt nun die echten Kosten.

In dieser Folge diskutieren Fabian Walther und Ole Wendland die neuesten Entwicklungen im KI-Modellmarkt. Im Fokus steht die Erkenntnis aus dem DeepSWE-Benchmark, dass Kosteneffizienz nicht allein vom Modellpreis abhängt, sondern von der Anzahl der benötigten Tokens. Anthropic signalisiert Profitabilität durch effizientere Modelle, während OpenAI mit Soul, Terra und Luna auf Effizienz setzt und SpaceX/xAI mit ihrem neuen Grok-Modell mit günstigen Preisen konkurrenzfähig wird. Parallel entstehen innovative Open-Source-Lösungen und neue Benchmarking-Ansätze, die sich an praktischen Deployments orientieren.

Zahlen & Fakten

13%

Mergebarkeitsquote von Opus 4.8 im Frontier-Code-Benchmark auf höchstem Schwierigkeitsgrad

1,5 Billionen

Parameter des neuen Grok-Modells von SpaceX/xAI

6 Dollar

Preis pro Million Output-Tokens beim neuen Grok-Modell

Weitere 7 Zahlen & Fakten anzeigen

300 Dollar

Token-Kosten, die Ole in einer Woche durch intensives Fable-Maxing aufbrachte

150–250 Dollar

Durchschnittliche monatliche Cloud-Code-Kosten pro Entwickler bei Anthropic

136 Dollar

Median der jährlichen Token-Investitionen pro Mitarbeiter in Unternehmen

90.000 Dollar

Spitzenwert bei Token-Investitionen pro Mitarbeiter in einzelnen Unternehmen

30 Gigabyte

RAM-Bedarf des Ornith-Modells in 4-Bit-Quantisierung

1 Milliarde

Erwarteter Gewinn von Anthropic für Q3

6 Billionen

Geschätzter Wert von Anthropic bis 2027, wenn Wachstum anhält

Diese Folge steckt voller Zahlen – neugierig?

Themen & Erkenntnisse

Fable-Erfahrung und Token-Kosteneffektivität · ab 02:05: Fable bekommt Gnadenfrist mit Quota-Reset. Erkenntnis: Günstigere Modelle mit Thinking-Levels sind oft kosteneffizienter als Fable, da sie weniger Tokens verbrauchen.
Neue Modellgenerationen und Benchmark-Realität · ab 13:00: OpenAI lanciert Soul/Terra/Luna mit Fokus auf Effizienz; DeepSWE vs. Frontier-Code zeigen: Benchmarks können optimiert werden, reale Mergbarkeit ist deutlich niedriger.
Konkurrenzmodelle und Open-Source-Ansätze · ab 22:02: SpaceX/xAI bringt günstiges Grok-Modell (1,5T Parameter, 6€ pro Million Tokens); Ornith-Modell zeigt Kraft von Open-Source-Remixes und lokalen Lösungen.

Quellen

StudieDeepSWE Benchmark

StudieFrontier Code Benchmark von Cognition (Firma hinter Devin)

StudieMeta Reward Hacking Benchmark

Weitere 2 Quellen anzeigen

StudiePrompt Injection as Role Confusion (Security Paper)

Ornith Open-Source-Modell auf Hugging Face

Alle Quellen findest du in der vollständigen Folge

Wer spricht

F
Fabian WaltherHOST

Co-Host des INNOQ Podcasts "AI News", diskutiert wöchentlich aktuelle KI-Entwicklungen und Sicherheitsthemen. Analytischer Sprecher mit Fokus auf Implikationen von KI-Sicherheit, Datenethik und Corporate Strategien großer Tech-Unternehmen.

Alle Auftritte von Fabian Walther
O
Ole WendlandHOST

Co-Host des INNOQ Podcasts "AI News", spezialisiert auf technische Analyse von Machine-Learning-Modellen, Trainingsdaten und Open-Source-Entwicklungen. Bringt tiefgehendes technisches Verständnis für Code-Engineering und Modelloptimierung ein.

Alle Auftritte von Ole Wendland

KIDieser Inhalt wurde KI-gestützt erstellt und redaktionell geprüft.