Gemini 3.1 pro: googles ki übertrifft gpt-5.2 in leistungstests
- Ein bedeutender fortschritt für google ki
- Verbesserte fähigkeiten im reasoning und problemlösen
- Vergleichstabelle: gemini 3.1 pro im direkten vergleich
- Herausragende leistung im humanity's last exam
- Arc-agi 2: ein klarer sieg für google
- Verfügbarkeit und ausblick auf google i/o 2026
- Tabellarische übersicht der benchmark-ergebnisse
Ein bedeutender fortschritt für google ki
Google hat mit der Veröffentlichung von Gemini 3.1 Pro einen neuen Meilenstein im Bereich der künstlichen Intelligenz erreicht. Das Update verbessert nicht nur die Fähigkeiten in der Code-Generierung, sondern verdoppelt auch die Leistung in wichtigen Workflow-Tests im Vergleich zu Konkurrenten wie GPT-5.2 von OpenAI. Google selbst bezeichnet es als “ein intelligenteres Modell für Ihre komplexesten Aufgaben” und betont seine Fähigkeit, über einfache Antworten hinauszugehen. Die Entwicklung stellt einen Fortschritt im Bereich des Kern-Reasonings dar.

Verbesserte fähigkeiten im reasoning und problemlösen
Gemini 3.1 Pro demonstriert seine Leistungsfähigkeit insbesondere bei der Lösung komplexer Probleme. Ein Beispiel hierfür ist der ARC-AGI-2 Benchmark, der die Fähigkeit eines Modells bewertet, völlig neue logische Muster zu erkennen und zu lösen. Hier erreichte Gemini 3.1 Pro eine verifizierte Punktzahl von 77,1%, mehr als doppelt so hoch wie die von Gemini 3 Pro. Dies unterstreicht die deutliche Verbesserung des Reasoning-Fähigkeiten.

Vergleichstabelle: gemini 3.1 pro im direkten vergleich
Um die Überlegenheit von Gemini 3.1 Pro zu belegen, hat Google eine Vergleichstabelle veröffentlicht, die die Ergebnisse des neuen Modells mit denen von Gemini 3 Pro, Sonnet 4.6, Opus 4.6, GPT-5.3-Codex und GPT-5.2 vergleicht. Besonders hervorzuheben sind die Ergebnisse in LiveCodeBenchPro, APEX-Agents, t2-bench, BrowseComp, MMMU Pro, MMMLU, MRCR v2 (8-needle) und Terminal-Bench 2.0.

Herausragende leistung im humanity's last exam
Ein besonders anspruchsvoller Benchmark ist der Humanity's Last Exam, der für seine hohe Komplexität bekannt ist und das fortgeschrittene Reasoning von KI-Modellen misst. Hier erreichte Gemini 3.1 Pro eine Punktzahl von 44,4%, was leicht über der vorherigen Version von Google KI (37,5%) liegt und OpenAI (34,5%) deutlich übertrifft. Dies bestätigt die Stärke von Gemini 3.1 Pro in anspruchsvollen Aufgaben.

Arc-agi 2: ein klarer sieg für google
Auch im ARC-AGI 2 Benchmark setzte sich Gemini 3.1 Pro durch. Mit einer Punktzahl von 77,1% übertraf es das Ergebnis von OpenAI (52,9%) deutlich. Diese Ergebnisse unterstreichen die überlegene Fähigkeit von Gemini 3.1 Pro, logische Probleme zu lösen und komplexe Zusammenhänge zu verstehen.
Verfügbarkeit und ausblick auf google i/o 2026
Gemini 3.1 Pro ist ab sofort für Entwickler in der Vorschauversion über die Gemini API in Google AI Studio, Gemini CLI, Google Antigravity und Android Studio verfügbar. Unternehmen können auf Vertex AI und Gemini Enterprise zugreifen. Verbraucher werden die neuen Funktionen über die Gemini App und NotebookLM nutzen können. Google hat zudem den Termin für Google I/O 2026 bekannt gegeben, wo weitere Fortschritte und Innovationen im Bereich Gemini erwartet werden.
Tabellarische übersicht der benchmark-ergebnisse
| Benchmark | Gemini 3.1 Pro | Gemini 3 Pro | GPT-5.2 |
|---|---|---|---|
| Humanity's Last Exam | 44.4% | 37.5% | 34.5% |
| ARC-AGI 2 | 77.1% | N/A | 52.9% |
| MCP Atlas | 85.9% | N/A | 59.5% |