Grok 4

Komentáře: 0
Grok 4 #0
Grok 4 #1
Grok 4 #2
4314
377

Pozice v celkovém hodnocení k datu
Červenec 2026
1
Hodnocení uživatelů
https://compare-ai.foundtt.com
4.4

Přehled modelu

Webová stránka
Webová stránka AI modelu
Poskytovatel
Subjekt, který poskytuje tento model.
Chat
Zadejte zprávu a začněte chatovat
Datum vydání
Kdy byl model poprvé vydán.
1 rok ago
Čvc 09, 2025
Modality
Typy dat, která tento model dokáže zpracovat
text ?
obrázky ?
hlas ?
video ?
Poskytovatelé API
Poskytovatelé, kteří tento model nabízejí. (Toto není vyčerpávající seznam.)
xAI
Datum uzávěrky znalostí
Kdy byly poslední aktualizace znalostí modelu.
-
Open Source
Zda je kód modelu k dispozici pro veřejné použití.
Ne
Cena za vstup
Cena za zpracování tokenů ve vašich výzvách
$3.00 na milion tokenů
Cena za výstup
Cena za tokeny generované modelem
$15.00 na milion tokenů
MMLU
Massive Multitask Language Understanding - Testuje znalosti v 57 oblastech, včetně matematiky, historie, práva a dalších
-
MMLU-Pro
Robustnější MMLU benchmark s těžšími, na uvažování zaměřenými otázkami, větším výběrem a nižší citlivostí na výzvy
-
MMMU
Massive Multitask Multimodal Understanding - Testuje porozumění napříč textem, obrázky, zvukem a videem
-
HellaSwag
Náročný benchmark pro dokončení vět
-
HumanEval
Hodnotí schopnosti generování kódu a řešení problémů
-
MATH
Testuje schopnosti řešení matematických problémů napříč různými úrovněmi obtížnosti
-
GPQA
Testuje znalosti na úrovni PhD z chemie, biologie a fyziky prostřednictvím otázek s výběrem, které vyžadují hlubokou odbornou znalost
87.5%
Science
Zdroj
IFEval
Testuje schopnost modelu přesně dodržovat explicitní formátovací pokyny, generovat vhodné výstupy a udržovat konzistenci dodržování pokynů napříč různými úkoly
-
SimpleQA
Hodnocení přesnosti jednoduchých otázek
-
AIME 2024
-
AIME 2025
91.7%
Competition Math
Zdroj
Aider Polyglot
Vícejazyčný programovací benchmark.
-
LiveCodeBench v5
Benchmark pro programování v reálném čase
79%
Competitive Coding
Zdroj
Global MMLU (Lite)
Zjednodušená verze benchmarku pro hodnocení univerzálnosti modelů na globální úrovni.
-
MathVista
Hodnotí schopnosti matematického uvažování modelů umělé inteligence ve vizuálních kontextech
-
Mobilní aplikace

MathArena ?

Průměrné skóre89%
AIME 2025
Test založený na úlohách ze soutěže v matematice (American Invitational Mathematics Examination),určený k ověření matematických dovedností modelů.
91%
HMMT February 2025
Test založený na úlohách z Harvard-MIT Mathematics Tournament, únor 2025, určený k ověření matematických dovedností modelů.
92%
BRUMO 202595%
SMT 2025
Test založený na úlohách ze Stanford Math Tournament, 2025, určený k ověření matematických dovedností modelů.
86%
CMIMC 2025
Test založený na úlohách z Canadian Mathematical Olympiad, 2025, určený k ověření matematických dovedností modelů.
83%

Přidat komentář

Porovnat LLM


10%
Naše stránky používají soubory cookie.

Zásady ochrany osobních údajů a souborů cookie: Tento web používá soubory cookie. Dalším používáním webu souhlasíte s jejich používáním.