Grok 4

Kommentare: 0
Grok 4 #0
Grok 4 #1
Grok 4 #2
4314
377

Position im Gesamtranking zum Stand von
Juli 2026
1
Benutzerbewertung
https://compare-ai.foundtt.com
4.4

Modellübersicht

Webseite
KI-Modell-Webseite
Anbieter
Die Entität, die dieses Modell bereitstellt.
Chat
Geben Sie eine Nachricht ein, um zu chatten
Veröffentlichungsdatum
Wann das Modell erstmals veröffentlicht wurde.
1 Jahr ago
Jul 09, 2025
Modalitäten
Arten von Daten, die dieses Modell verarbeiten kann
Text ?
Bilder ?
Sprache ?
Video ?
API-Anbieter
Die Anbieter, die dieses Modell anbieten. (Diese Liste ist nicht vollständig.)
xAI
Datum des Wissensstandes
Wann das Wissen des Modells zuletzt aktualisiert wurde.
-
Open Source
Ob der Code des Modells öffentlich verfügbar ist.
Nein
Preisgestaltung Eingabe
Kosten für die Verarbeitung von Token in Ihren Eingaben
$3.00 pro Million Token
Preisgestaltung Ausgabe
Kosten für vom Modell generierte Token
$15.00 pro Million Token
MMLU
Massive Multitask Language Understanding – Testet Wissen in 57 Fächern, darunter Mathematik, Geschichte, Recht und mehr
-
MMLU-Pro
Ein robusterer MMLU-Benchmark mit schwierigeren, auf logisches Denken fokussierten Fragen, einer größeren Auswahl an Antworten und geringerer Sensitivität für Eingabevariationen
-
MMMU
Massive Multitask Multimodal Understanding – Testet das Verständnis über Text, Bilder, Audio und Video hinweg
-
HellaSwag
Ein anspruchsvoller Benchmark für Satzvervollständigung
-
HumanEval
Bewertet Codegenerierung und Problemlösungsfähigkeiten
-
MATH
Testet mathematische Problemlösungsfähigkeiten auf verschiedenen Schwierigkeitsstufen
-
GPQA
Testet Wissen auf PhD-Niveau in Chemie, Biologie und Physik durch Multiple-Choice-Fragen, die tiefgehendes Fachwissen erfordern
87.5%
Science
Quelle
IFEval
Testet die Fähigkeit des Modells, Formatierungsvorgaben genau zu befolgen, angemessene Ausgaben zu generieren und konsistente Instruktionsbefolgung über verschiedene Aufgaben hinweg zu gewährleisten
-
SimpleQA
Bewertung der Genauigkeit einfacher Fragen
-
AIME 2024
-
AIME 2025
91.7%
Competition Math
Quelle
Aider Polyglot
Mehrsprachige Programmier-Benchmark.
-
LiveCodeBench v5
Benchmark für Echtzeit-Programmierung
79%
Competitive Coding
Quelle
Global MMLU (Lite)
Eine vereinfachte Version des Benchmarks zur Beurteilung der Universalität von Modellen auf globaler Ebene.
-
MathVista
Bewertet die mathematischen Denkfähigkeiten von KI-Modellen in visuellen Kontexten
-
Mobile Anwendung

MathArena ?

Durchschnittliche Punktzahl89%
AIME 2025
Test basierend auf Aufgaben aus dem Mathematikwettbewerb (American Invitational Mathematics Examination),der die mathematischen Fähigkeiten von Modellen überprüfen soll.
91%
HMMT February 2025
Test basierend auf Aufgaben aus dem Harvard-MIT Mathematics Tournament, Februar 2025, der die mathematischen Fähigkeiten von Modellen überprüfen soll.
92%
BRUMO 202595%
SMT 2025
Test basierend auf Aufgaben aus dem Stanford Math Tournament, 2025, der die mathematischen Fähigkeiten von Modellen überprüfen soll.
86%
CMIMC 2025
Test basierend auf Aufgaben aus der Canadian Mathematical Olympiad, 2025, der die mathematischen Fähigkeiten von Modellen überprüfen soll.
83%

Kommentar hinzufügen

LLMs vergleichen


10%
Unsere Website verwendet Cookies.

Datenschutz und Cookie-Richtlinie: Diese Website verwendet Cookies. Wenn Sie die Seite weiter nutzen, stimmen Sie deren Verwendung zu.