DeepSeek · DeepSeek
DeepSeek-V4-Pro
deepseek-v4-pro
Erste WahlOpen-Weight-Preis-Leistung
- Self-Hosting
- kostensensitives Reasoning
- lange Generierungen
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 1 Mio.
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Max. Ausgabe
- 384 K Token
- Preis (Input / Output)
- $0.435 / $0.87 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 80,9 Indexpkt. je $/Mio. Token
Stärken
Offene Gewichte (auf HuggingFace publiziert, lokal/self-hosted möglich) 1-Mio.-Token-Kontext und sehr großer max. Output (384 K) Thinking-Mode, Tool-Calls und JSON-Output
Schwächen
Hoher Output-Preis relativ zum Input (API) Laut Doku reine Text-Modalität
Typische Einsatzfälle
lange Generierungen Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → Self-Hosted-Einsatz
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 44AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 59AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 67Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 64τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen → 96Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1457
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
44
(Max)
unabhängigArtificial Analysis, abgerufen 2026-06-16
Artificial Analysis Coding Index
59
(Max)
unabhängigArtificial Analysis Coding Index, abgerufen 2026-07-09
Artificial Analysis Agentic Index
67
(Max)
unabhängigArtificial Analysis Agentic Index, abgerufen 2026-06-16
LMArena Text Arena (Elo)
1457
unabhängigLMArena (arena.ai), Stand 2026-06-10
DeepSWE (Long-Horizon Coding)
8 %
unabhängigdeepswe.lol (kontaminationsfrei, mini-swe-agent), 2026-06-16
Terminal-Bench (agentische Shell-Aufgaben)
64 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
τ²-bench (Tool-Use-Verlässlichkeit)
96 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
Einordnung
Im Beleg · SekundärquelleAA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 59 – klar vor Grok 4.3 (42), aber unter Gemini 3.5 Flash (70); bei offenen Gewichten (lokal/self-hosted betreibbar) und sehr günstigem API-Preis ($0,44 / $0,87). Unter den Open-Weight-Modellen liegen nur die teureren GLM-5.2 (69) und Kimi K2.6 (62) beim Coding höher.Langer-Kontext-Champion der offenen Gewichte: unterstützt nativ 1 Mio. Beleg · CommunityTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → mit laut Tech Report nahezu state-of-the-art Retrieval und gilt als bestes Open-Source-Modell dieser Kontextgröße – dazu eine dauerhaft auf rund 75 % gesenkte API gegenüber V3.2. Die Budget-Wahl, wenn lange Kontexte ohne Vendor-Lock-in gebraucht werden.
Aus der System-Card
Verdichtete Befunde aus der offiziellen
Fähigkeiten
- Coding –
Laut Report (Fig. 1) erreicht DeepSeek-V4-Pro-Max bei „ SWE-benchCoding-Benchmark, der Modelle echte GitHub-Issues in realen Repositories lösen lässt; gewertet wird, ob der erzeugte Patch die Tests besteht. Verbreitet, aber zunehmend durch Trainings-Kontamination belastet.Mehr im Wissen → “ 80,6 % – im Chart auf Augenhöhe mit Opus 4.6-Max und GPT-5.4-xHigh. - Architektur –
Laut Report kombiniert es eine hybride Attention aus Compressed Sparse AttentionAufmerksamkeits-Mechanismus, der nicht jeden Token mit jedem vergleicht, sondern nur eine ausgewählte Teilmenge. Das senkt Rechen- und Speicheraufwand bei sehr langen Kontexten erheblich.Mehr im Wissen → (CSA) und Heavily Compressed Attention (HCA) mit Manifold-Constrained Hyper-Connections (mHC) und dem Muon-Optimizer, um 1M-Token-Kontext effizient zu tragen. - Long-Context-Effizienz –
Laut Report braucht es im 1M-Token-Kontext nur noch 27 % der Single-Token-FLOPs und 10 % des KV-Caches gegenüber DeepSeek-V3.2. - Reasoning –
Laut Report schlägt der Maximal-Reasoning-Modus „Pro-Max“ auf Standard-Reasoning-Benchmarks GPT-5.2 und Gemini 3.0 Pro, bleibt aber hinter GPT-5.4 und Gemini 3.1 Pro.
Verhalten & Sicherheit
- Lizenz –
Laut Model-Card stehen Modellgewichte und Code unter der MIT-Lizenz – einer freien, permissiven Lizenz ohne Nutzer-/MAU-Schranken. - Vorgesehene Nutzung –
Laut Model-Card ist V4 ein Allzweck-Modell (Q&A, allgemeine Agenten-Aufgaben) mit drei Reasoning-Modi: Non-think, Think High und Think Max. - Datenschutz –
Laut Model-Card sammelt das Pre-Training keine personenbezogenen Daten absichtlich; sensible Infos, Kreditkartennummern und eindeutige Identifikatoren werden gefiltert, einfließende Nutzereingaben verschlüsselt und de-identifiziert. - Trainingsdaten –
Laut Model-Card stützt sich das Training auf öffentlich verfügbare Internetdaten plus lizenzierte Drittanbieter-Datensätze, mit Betonung von IP-, Geschäftsgeheimnis- und Datenschutz-Konformität. - API-Nutzung –
Neben den offenen Gewichten gibt es eine API; deren Nutzung unterliegt den „DeepSeek Open Platform Terms of Service“.
DeepSeek – DeepSeek-V4 Technical Report (PDF)· Primärquelle, abgerufen 2026-06-16
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- positivWürdigt DeepSeeks Infrastruktur- und Architekturdesign anschlussfähig am 58-seitigen Tech Report – hybride Attention (CSA/HCA), FP4-Quantization-Aware-Training für den Indexer und der Muon-Optimizer („absolut umwerfend, und das alles frei geteilt“).bycloud (YouTube) – „The Insane Infrastructure Design of DeepSeek V4“ · Community
- gemischtErnstzunehmender Open-Weight-Frontier-Kandidat, dessen Existenz als Herausforderung an US-Anbieter gilt – ob er echten Frontier-Anschluss hält oder nur Effizienz-Champion der Open-Source-Liga ist, sieht die Szene als offen an.Cognitive Revolution (YouTube) · Community
- kritischIm Coding-Agentic-Bereich klare Schwäche: bei echten Multi-File-Codebase-Aufgaben fällt das Modell laut Beobachtern schnell ab und liegt deutlich hinter GPT-5.5.Theo – t3.gg (YouTube) · Community
- kritischIm eigenen Dokument-Extraktions-Test des Hosts (ein Behördenformular treu auslesen) lag „das neueste DeepSeek“ – wie alle getesteten China-Modelle – weit hinter Gemini 3, Claude Opus 4.5 und ChatGPT; der Host räumt aber ein, hier teils nach Bauchgefühl zu urteilen.Cognitive Revolution (YouTube) · Community
ℹ️