DeepSeek-R1

Commentaires: 1
DeepSeek-R1 #0
DeepSeek-R1 #1
DeepSeek-R1 #2

DeepSeek-R1 est un modèle Mixture-of-Experts (MoE) de 671 milliards de paramètres, avec 37 milliards de paramètres activés par token, entraîné via un apprentissage par renforcement à grande échelle avec un accent sur les capacités de raisonnement. Il intègre deux étapes de RL pour découvrir des schémas de raisonnement améliorés et s’aligner sur les préférences humaines, ainsi que deux étapes de SFT pour amorcer les capacités de raisonnement et non-raisonnement. Le modèle atteint des performances comparables à OpenAI-o1 sur les tâches de mathématiques, de codage et de raisonnement.

1224
21

Position dans le classement général au
Juillet 2026
5
Évaluation des utilisateurs
https://compare-ai.foundtt.com
4.2

Présentation du modèle

Site web
Page web du modèle d’IA
Fournisseur
L’entité qui fournit ce modèle.
Chat
Entrez un message pour commencer à discuter
-
Date de sortie
Première date de publication du modèle.
1 an ago
Jan 21, 2025
Modalités
Types de données que ce modèle peut traiter
texte ?
Fournisseurs d’API
Les fournisseurs qui proposent ce modèle. (Cette liste n’est pas exhaustive.)
DeepSeek, HuggingFace
Date de mise à jour des connaissances
Dernière mise à jour des connaissances du modèle.
Inconnu
Open Source
Disponibilité du code du modèle pour une utilisation publique.
Oui
Tarification d’entrée
Coût du traitement des tokens dans vos invites
$0.55 par million de tokens
Tarification de sortie
Coût des tokens générés par le modèle
$2.19 par million de tokens
MMLU
Massive Multitask Language Understanding - Évalue les connaissances dans 57 domaines, y compris les mathématiques, l’histoire, le droit et plus encore
90.8%
Pass@1
Source
MMLU-Pro
Un benchmark MMLU plus robuste avec des questions plus complexes axées sur le raisonnement, un plus grand ensemble de choix et une sensibilité réduite aux invites
84%
EM
Source
MMMU
Massive Multitask Multimodal Understanding - Évalue la compréhension à travers le texte, les images, l’audio et la vidéo
-
HellaSwag
Un benchmark exigeant de complétion de phrases
-
HumanEval
Évalue la génération de code et les capacités de résolution de problèmes
-
MATH
Évalue les capacités de résolution de problèmes mathématiques à différents niveaux de difficulté
-
GPQA
Évalue les connaissances de niveau doctorat en chimie, biologie et physique via des questions à choix multiples nécessitant une expertise approfondie
71.5%
Pass@1
Source
IFEval
Évalue la capacité du modèle à suivre avec précision des instructions de formatage explicites, à générer des sorties appropriées et à maintenir une cohérence dans l’exécution des tâches
83.3%
Prompt Strict
Source
SimpleQA
Évaluation de la précision des questions simples
-
AIME 2024
-
AIME 2025
-
Aider Polyglot
Benchmark de programmation multilingue.
-
LiveCodeBench v5
Benchmark pour la programmation en temps réel
-
Global MMLU (Lite)
Une version simplifiée du benchmark pour évaluer l’universalité des modèles au niveau mondial.
-
MathVista
Évalue les capacités de raisonnement mathématique des modèles d’IA dans des contextes visuels
-
Application mobile

MathArena ?

Score moyen82%
AIME 2025
Test basé sur des problèmes issus du concours de mathématiques (American Invitational Mathematics Examination),destiné à évaluer les compétences mathématiques des modèles.
89%
HMMT February 2025
Test basé sur des problèmes du Harvard-MIT Mathematics Tournament, février 2025, destiné à évaluer les compétences mathématiques des modèles.
77%
BRUMO 202592%
SMT 2025
Test basé sur des problèmes du Stanford Math Tournament, 2025, destiné à évaluer les compétences mathématiques des modèles.
83%
CMIMC 2025
Test basé sur des problèmes de l’Olympiade mathématique canadienne, 2025, destiné à évaluer les compétences mathématiques des modèles.
69%

Commentaires (1)

  1. Jacquie

    27 Janvier 2026

    Digiturk paketler icinden size en uygun uyeligi kolayca secebilirsiniz. https://digiturkpaketler.com/kampanyalar

Ajouter un commentaire

Comparer les LLMs


10%
Notre site utilise des cookies.

Politique de confidentialité et de cookies: ce site utilise des cookies. En continuant à utiliser le site, vous acceptez leur utilisation.