


موقع الويب صفحة نموذج الذكاء الاصطناعي على الويب | |
المزود الكيان الذي يوفر هذا النموذج. | |
الدردشة أدخل رسالة لبدء الدردشة | |
تاريخ الإصدار تاريخ الإصدار الأول للنموذج. | 1 سنة ago ماي 22, 2025 |
الوسائط أنواع البيانات التي يمكن لهذا النموذج معالجتها | نص صور |
مزودو API المزودون الذين يقدمون هذا النموذج. (هذه ليست قائمة شاملة.) | Anthropic API, Amazon Bedrock, Google Cloud's Vertex AI |
تاريخ قطع المعرفة تاريخ آخر تحديث لمعرفة النموذج. | غير معروف |
مفتوح المصدر ما إذا كان كود النموذج متاحًا للاستخدام العام. | لا |
تسعير الإدخال تكلفة معالجة الرموز في مطالباتك | $15 |
تسعير الإخراج تكلفة الرموز التي يولدها النموذج | $75 لكل مليون رمز |
MMLU فهم اللغة متعدد المهام الضخم - يختبر المعرفة عبر 57 موضوعًا بما في ذلك الرياضيات والتاريخ والقانون والمزيد | 88.8% المصدر |
MMLU-Pro معيار MMLU أكثر قوة مع أسئلة أكثر صعوبة تركز على التفكير، ومجموعة اختيار أكبر، وتقليل حساسية المطالبة | - |
MMMU فهم متعدد المهام والوسائط الضخم - يختبر الفهم عبر النصوص والصور والصوت والفيديو | 76.5% المصدر |
HellaSwag معيار إكمال الجمل الصعب | - |
HumanEval يقيم قدرات توليد الكود وحل المشكلات | - |
MATH يختبر قدرات حل المشكلات الرياضية عبر مستويات صعوبة مختلفة | - |
GPQA يختبر المعرفة على مستوى الدكتوراه في الكيمياء والأحياء والفيزياء من خلال أسئلة متعددة الخيارات تتطلب خبرة عميقة في المجال | 79.6% Diamond المصدر |
IFEval يختبر قدرة النموذج على اتباع تعليمات التنسيق الصريحة بدقة، وتوليد مخرجات مناسبة، والحفاظ على الالتزام بالتعليمات عبر مهام مختلفة | - |
SimpleQA تقييم دقة الأسئلة البسيطة | - |
AIME 2024 | - |
AIME 2025 | 75.5% المصدر |
Aider Polyglot معيار البرمجة متعدد اللغات. | - |
LiveCodeBench v5 معيار للبرمجة في الوقت الحقيقي | - |
Global MMLU (Lite) نسخة مبسطة من المعيار لتقييم عالمية النماذج على المستوى العالمي. | - |
MathVista تقييم قدرات التفكير الرياضي لنماذج الذكاء الاصطناعي في سياقات بصرية | - |
تطبيق الجوال |
Compare AI. Test. Benchmarks. تطبيبات دردشة الجوال, Sketch
Copyright © 2026 All Right Reserved.
تعليقات (1)
Tawfiq
18 يوليو 2025اريد claude opus