Introduction
Anthropic a discrètement divulgué, dans son rapport sur les risques d'août 2026, un modèle d'IA interne non publié nommé Model 2.
Ce modèle n'est pas une version publique de Claude, et Anthropic ne l'a pas publié en tant que produit. Il apparaît dans le rapport parce que l'entreprise a inclus les systèmes internes de pointe et quasi-pointe dans son évaluation des risques liés à l'IA avancée.
Selon Anthropic, le Model 2 dispose de capacités globales légèrement supérieures à Claude Mythos 5.
L'amélioration est réelle, mais l'entreprise a prudemment évité de la décrire comme un saut générationnel majeur.
Le résumé d'Anthropic indique que le Model 2 surpasse nettement Mythos 5 sur de nombreuses tâches liées à l'usage interne, mais reste loin de l'ampleur du bond capacitaire observé lors du passage de Claude Opus 4.6 à Claude Mythos Preview.
Cela rend le Model 2 significatif sous un angle différent.
Plutôt que de marquer l'arrivée d'une toute nouvelle génération, il s'apparente davantage à un perfectionnement continu des capacités des modèles de pointe d'Anthropic.
Le rapport fournit également un point de données concret : dans l'évaluation interne CoBench d'Anthropic, le Model 2 obtient un score de 62,8 %, devant Claude Mythos 5 à 50,3 % et Claude Mythos Preview à 54,8 %.

Le même rapport mentionne également un autre système interne, Model 1, ce qui a suscité des spéculations : Anthropic développe-t-elle une série de modèles internes avant de leur attribuer des noms de produits publics Claude ?
Le rapport officiel ne soutient que partiellement cette interprétation.
Anthropic confirme que Model 1 et Model 2 sont des modèles internes, mais n'affirme pas que le Model 2 est le successeur officiel du Model 1, ni que l'un ou l'autre deviendra une future version de Claude.
Le Model 2 est globalement légèrement supérieur à Claude Mythos 5
Le point central du rapport d'AIBase est exact : Anthropic indique que le Model 2 est globalement supérieur à Claude Mythos 5.
Le rapport sur les risques d'août de l'entreprise décrit le Model 2 comme suit :
- Supérieur à Mythos 5 dans certains domaines.
- Inférieur à Mythos 5 dans d'autres domaines.
- Globalement légèrement supérieur.
Anthropic indique également que son évaluation qualitative approximative est que le Model 2 offre des améliorations notables sur de nombreuses tâches liées à l'usage interne.
Cette formulation est importante.
Le Model 2 ne doit pas être décrit comme systématiquement supérieur à Mythos 5 sur chaque benchmark ou chaque domaine lié aux risques.
Le rapport lui-même montre que les résultats comparatifs varient selon les tâches.
Par exemple, dans certaines évaluations de risques chimiques et biologiques, Anthropic indique que les résultats limités du Model 2 sont comparables ou inférieurs à ceux de Claude Mythos 5.
Dans une autre évaluation de comportements clandestins, le Model 2 est légèrement supérieur à Mythos 5, mais reste nettement inférieur à Mythos Preview.
Le résumé le plus équitable est donc :
Model 2
= capacités globales légèrement supérieures
≠ supérieur sur chaque évaluation
L'amélioration ne constitue pas un saut générationnel majeur
Le texte original souligne que cette amélioration est relativement limitée.
Anthropic indique que, par rapport à…
Même situation.
L'entreprise compare spécifiquement le Model 2 à la transition précédente, à savoir le passage de Claude Opus 4.6 à Claude Mythos Preview.
Cette transition représentait une amélioration capacitaire bien plus importante.
Ce n'est pas le cas du Model 2.
Anthropic déclare que ce modèle interne plus récent présente des améliorations notables sur de nombreuses tâches internes, mais qu'il ne s'agit pas d'un changement perturbateur de même ampleur.
Cela se reflète également dans un autre indicateur de capacité interne.
Anthropic maintient une version interne de l'indice de capacité Epoch, appelée AECI, qui agrège les performances sur plusieurs benchmarks internes.
Selon des données limitées, le score du Model 2 est d'environ :
1,5 point AECI
au-dessus de Claude Mythos 5.
Anthropic précise explicitement que cette estimation comporte une marge d'erreur importante.
Elle indique également que cette augmentation est inférieure à l'amélioration observée entre Mythos Preview et Mythos 5.
Cela confirme la principale qualification de l'article : le Model 2 semble être une amélioration progressive des modèles de pointe, et non une nouvelle phase capacitaire clairement distincte.
CoBench fournit la comparaison publique la plus claire
Les preuves les plus concrètes du rapport proviennent de CoBench.
Anthropic décrit CoBench comme une évaluation interne conçue pour tester la capacité des modèles à résoudre les problèmes de recherche et développement réels de l'entreprise, plutôt que d'utiliser des benchmarks génériques comme indicateurs indirects.
Cette évaluation place le modèle à un moment donné de l'historique de l'infrastructure d'Anthropic.
Le modèle reçoit un instantané des ressources, comprenant :
- Du code.
- Des journaux.
- Des documents internes.
- Des messages internes historiques.
Il doit ensuite diagnostiquer la cause racine de problèmes techniques que les ingénieurs d'Anthropic ont déjà résolus par le passé.
La version actuelle décrite dans le rapport d'août comprend :
449 problèmes
provenant principalement de problèmes résolus entre février et avril 2026.
Ces problèmes proviennent de services de l'organisation technique d'Anthropic impliqués dans les domaines suivants :
- L'entraînement des modèles.
- L'exploitation de l'infrastructure des modèles.
- Le débogage de systèmes techniques.
- La recherche en ingénierie.
Cela rend CoBench particulièrement pertinent pour l'attention qu'Anthropic porte à l'automatisation de la recherche en IA par l'IA.
Le Model 2 obtient un score de 62,8 % sur CoBench
Les scores comparatifs présentés dans le rapport sont les suivants :
| Modèle | Score CoBench |
|---|---|
| Claude Sonnet 4.6 | 12,0 % |
| Claude Opus 4.6 | 15,6 % |
| Claude Opus 4.7 | 27,4 % |
| Claude Mythos 5 | 50,3 % |
| Claude Mythos Preview | 54,8 % |
| Model 2 | 62,8 % |
Le Model 2 se trouve donc en tête des modèles présentés dans le tableau.
Son avantage par rapport à Mythos 5 est de :
62,8 %
- 50,3 % = 12,5 points de pourcentage
Sur ce benchmark interne spécifique, c'est un écart significatif.
Mais cela reste bien en deçà du score qu'Anthropic estime nécessaire pour remplacer totalement son personnel technique.
Anthropic estime qu'un score d'environ 85 % serait nécessaire pour remplacer entièrement les chercheurs
Anthropic indique que, sur la base d'un examen manuel des tâches et des processus de notation, un système capable de remplacer véritablement et entièrement les scientifiques et ingénieurs de recherche d'Anthropic devrait obtenir un score d'au moins environ :
85 %
sur CoBench.
Le score de 62,8 % du Model 2 reste donc loin de ce seuil.
Anthropic précise également que ce benchmark ne mesure pas parfaitement l'équivalence avec les humains.
L'ensemble de données a été
délibérément filtré pour inclure des problèmes difficiles.
La plupart des tâches ont été sélectionnées parce que Mythos Preview avait échoué au moins une fois sur trois tentatives.
Anthropic indique que sans ce filtrage, la taille de l'ensemble de données serait environ deux fois plus grande.
D'autres limites existent :
- Certaines conclusions humaines historiques peuvent être imparfaites.
- Certaines réponses peuvent être ambiguës.
- La notation automatique peut commettre des erreurs.
Le modèle ne dispose pas réellement de toutes les autorisations ou de l'infrastructure de support dont pourrait bénéficier un véritable ingénieur Anthropic.
Par conséquent, CoBench est mieux perçu comme un signal interne utile plutôt que comme une référence universelle permettant de déterminer si un modèle d'IA peut remplacer un chercheur.
Octroyer davantage de tokens à Mythos 5 ne comble pas entièrement l'écart
Anthropic a également testé si les résultats de CoBench reflétaient simplement un budget de raisonnement insuffisant.
Le budget de tokens utilisé pour ce graphique est d'environ :
300 000 tokens
pour la configuration évaluée.
Lorsqu'Anthropic a augmenté le budget de Mythos 5 à :
900 000 tokens
son score n'a progressé que d'environ :
3 points de pourcentage
Cela indique qu'au moins une partie de l'avantage du Model 2 ne peut pas s'expliquer uniquement en donnant davantage de tokens à Mythos 5.
Anthropic estime toujours qu'un meilleur échafaudage et de meilleurs cadres d'évaluation pourraient améliorer les résultats ; cette référence ne mesure donc pas purement les poids du modèle lui-même.
L'architecture des agents est importante.
Le Model 2 est déjà largement utilisé en interne chez Anthropic
Le Model 2 n'est pas encore publié, mais il ne s'agit pas simplement d'un point de contrôle de laboratoire inutilisé.
Anthropic indique que le Model 2 et Claude Mythos 5 figurent parmi ses modèles internes les plus performants et les plus fréquemment utilisés.
Ils sont massivement employés pour :
- La programmation.
- La génération de données.
- D'autres flux de travail agentiques.
- La recherche.
- L'ingénierie.
Anthropic précise également que ces deux modèles sont utilisés via des déploiements agentiques persistants, et pas seulement dans des sessions de chat interactives.
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Ce point est important, car la section consacrée aux risques dans le rapport s'intéresse en partie à la possibilité que les systèmes d'IA automatisent une part croissante du travail de recherche et développement d'Anthropic elle-même.
Le rapport indique que Claude rédige désormais la grande majorité du code fusionné dans le référentiel de production d'Anthropic.
Cependant, Anthropic n'en conclut pas que ses modèles sont actuellement capables de remplacer entièrement ses chercheurs.
L'entreprise considère que l'IA accélère considérablement le travail interne, mais son évaluation d'août reste en deçà des seuils de la politique de déploiement responsable concernant une accélération fortement induite par l'IA de la R&D.
Le Model 2 n'a pas encore suivi l'intégralité de la batterie d'évaluations pré-déploiement d'Anthropic
Le rapport contient également une autre mise en garde importante.
Le Model 2 a passé le processus interne d'examen de déploiement d'Anthropic, mais il n'a pas encore été soumis à la suite complète d'évaluations que l'entreprise exécute généralement avant un déploiement externe.
Par conséquent, Anthropic indique avoir un niveau de confiance légèrement inférieur dans sa compréhension du Model 2 par rapport à celle des modèles publiés ayant fait l'objet d'une évaluation complète.
Cela est important pour interpréter les comparaisons de référence.
Un résultat CoBench unique peut indiquer que le Model 2 est performant sur les tâches internes de R&D.
Mais il ne permet pas d'établir un profil de performance complet couvrant :
- Le raisonnement général.
- La programmation.
- La cybersécurité.
- La biologie.
- La sécurité.
- L'alignement.
- L'autonomie sur de longues périodes.
- L'utilisation grand public.
- Les environnements d'entreprise.
La charge de travail.
La conclusion actuelle d'Anthropic reste volontairement générale : le Model 2 semble globalement légèrement supérieur à Mythos 5.
Anthropic n'a actuellement aucun projet de publier le Model 2 en externe
Dans le bref article d'AIBase, le détail pratique le plus important est facile à manquer.
Anthropic indique clairement :
Nous n'avons actuellement aucun projet
de publier ce modèle en externe.
Il ne faut donc pas considérer le Model 2 comme un futur produit Claude avec une date de sortie implicite.
Il n'existe actuellement aucune information officielle concernant :
- La date de sortie.
- Le nom public du modèle.
- L'identifiant du modèle dans l'API Claude.
- La tarification.
- Les spécifications de fenêtre contextuelle.
- Les plans de disponibilité grand public.
- Les plans de déploiement en entreprise.
Toute affirmation selon laquelle le Model 2 deviendrait « Claude Mythos 6 », « Claude Opus 6 » ou tout autre produit nommé n'est que pure spéculation.
Anthropic divulgue ce modèle parce que ses modèles internes sont pertinents pour l'évaluation des risques de l'entreprise.
Cela diffère de la publication d'un produit.
Claude Mythos 5 n'est en réalité pas un modèle public largement disponible
Le titre original d'AIBase affirme que Claude Mythos 5 est le modèle public le plus performant d'Anthropic.
Cette affirmation mérite d'être nuancée.
Claude Mythos 5 n'est pas largement disponible.
Anthropic ne propose actuellement ce modèle qu'à un ensemble limité de clients approuvés via Project Glasswing et les programmes d'accès de confiance associés.
La version largement disponible correspondante est Claude Fable 5.
Anthropic précise que Fable 5 et Mythos 5 utilisent le même modèle sous-jacent.
La différence réside dans le fait que Fable 5 intègre des garde-fous plus stricts dans des domaines sensibles tels que la cybersécurité et la biologie, tandis que Mythos 5 est proposé aux utilisateurs vérifiés qui ont besoin de moins de restrictions dans le cadre de travaux autorisés.
La relation produit actuelle est la suivante :
Claude Mythos 5
= Accès de confiance restreint
Claude Fable 5
= Même modèle sous-jacent
+ Garde-fous renforcés
+ Large disponibilité
Par conséquent, pour le lecteur moyen, une formulation plus précise serait : Mythos 5 est le modèle de pointe à accès restreint le plus performant d'Anthropic, tandis que Fable 5 est son modèle largement publié le plus capable.
Le Model 1 est réel, mais le récit produit « Model 1 → Model 2 » relève de la pure spéculation
Le rapport mentionne également le Model 1.
Cela suffit naturellement à susciter des spéculations :
Model 1
→ Model 2
→ futures versions de Claude ?
Mais Anthropic ne fait pas une telle déclaration.
En réalité, sa description du Model 1 est plutôt sobre.
L'entreprise indique que le Model 1 est à peu près équivalent en capacités à :
- Claude Mythos Preview.
- Claude Mythos 5.
Son déploiement interne a été relativement limité.
Anthropic déclare que la grande majorité des utilisateurs internes préfèrent Mythos 5, et que l'utilisation du Model 1 était déjà faible et en déclin à la date de couverture du rapport, soit le 15 juillet.
L'entreprise indique également :
Elle prévoit que le Model 1 ne fera pas l'objet
d'un déploiement externe ni d'une large
utilisation interne à l'avenir
Ainsi, le Model 1 ressemble davantage à une branche de développement interne ou à un point de contrôle qu'à un prédécesseur clairement défini attendant une publication publique.
Le Model 2 diffère du Model 1 sur un point important
Anthropic adopte une approche nettement plus prudente concernant le Model 2.
Le Model 1 n'est que brièvement évoqué, puis essentiellement exclu de l'analyse des risques, car Anthropic
considère que Mythos 5 constitue une limite supérieure raisonnable pour son niveau de risque.
En revanche, le Model 2 est utilisé dans une grande partie du rapport parce qu'il :
- Est globalement plus performant.
- Est plus fréquemment utilisé en interne.
- Est pertinent pour l'analyse des risques de pointe d'Anthropic.
Le rapport indique que l'utilisation interne du Model 2 est similaire à celle de Mythos 5.
Cela ne prouve pas une publication publique imminente.
Mais cela montre que le Model 2 occupe une position opérationnelle importante au sein d'Anthropic.
Le rapport sur les risques est la raison pour laquelle le modèle est devenu public
Le Model 2 n'a pas été lancé via un article de blog de publication traditionnel.
Il apparaît parce que la politique de déploiement responsable d'Anthropic exige que l'entreprise réalise des analyses de risques sur les systèmes réellement développés et déployés en interne.
Le rapport sur les risques d'août 2026 couvre les activités d'Anthropic jusqu'au 15 juillet 2026.
Anthropic répertorie les modèles internes lorsqu'ils sont pertinents pour des questions telles que :
- Les problèmes de désalignement dans les environnements à haut risque.
- La R&D automatisée par l'IA.
- Les risques biologiques et chimiques.
- La sécurité des modèles.
- La surveillance interne.
C'est pourquoi le Model 2 apparaît dans le rapport.
获得的信息比普通未发布模型会得到的更多。
这一披露首先是安全治理的产物,其次才是产品泄露。
报告告诉了我们什么,又没有告诉我们什么
| 说法 | 状态 |
|---|---|
| Anthropic 有一个名为模型 2 的内部模型 | 已确认 |
| 模型 2 尚未发布 | 已确认 |
| 模型 2 整体上比 Mythos 5 略强 | Anthropic 已确认 |
| 模型 2 在每个领域都比 Mythos 5 更好 | 否 |
| 模型 2 在报告显示的 CoBench 对比中得分 62.8% | 在报告数据中已确认 |
| Mythos 5 在同一对比中得分 50.3% | 在报告数据中已确认 |
| Anthropic 估计在 CoBench 上实现全技术员工替代率约为 85% | 已确认 |
| 模型 2 在内部被大量使用 | 已确认 |
| 模型 2 已完成完整的常规外部发布评估套件 | 否 |
| Anthropic 目前计划公开推出模型 2 | 否 |
| 模型 2 有正式的 Claude 产品名称 | 否 |
| 模型 1 是一个真实的内部模型 | 已确认 |
| 模型 1 确定是模型 2 的直接前身 | 尚未确定 |
| 模型 1 预计将公开推出 | 否 |
| Claude Mythos 5 已向所有人开放使用 | 否 |
| Claude Fable 5 是对应 Mythos 5 的广泛发布版本 | 已确认 |
常见问题
什么是 Anthropic 模型 2?
模型 2 是 Anthropic 2026 年 8 月风险报告中披露的一个未发布的内部前沿模型。Anthropic 表示,它整体上比 Claude Mythos 5 略强,并且已在公司内部广泛用于编码、数据生成、研究、工程以及其他智能体工作。
模型 2 比 Claude Mythos 5 更好吗?
总体而言,Anthropic 说是的——但只是略好。该公司还表示,模型 2 在某些领域更强,在其他领域更弱,因此不应将其描述为全面超越。
模型 2 的 CoBench 得分是多少?
报告中显示的对比显示,模型 2 得分 62.8%,领先于 Mythos Preview 的 54.8% 和 Mythos 5 的 50.3%。Anthropic 估计,一个完全具备能力的模型
其技术人员的替代能力在当前的评估中至少需要达到大约85%。
CoBench评估什么?
CoBench是Anthropic基于其技术人员以往解决过的历史研究和工程问题而设计的内部评估。模型会收到历史快照,包括代码、日志、内部消息和文档,并且必须诊断出底层的技术问题。
Anthropic会发布Model 2吗?
Anthropic表示,目前没有计划对外发布Model 2。该公司尚未公布产品名称、发布日期、API标识符、定价或公开访问计划。
Model 2是下一个Claude Mythos模型吗?
Anthropic并未如此表示。Model 2是风险报告中使用的内部标识符,将其对应为未来的Claude产品名称纯属猜测。
什么是Anthropic Model 1?
Model 1是同一份报告中披露的另一个内部模型。Anthropic表示,它与Mythos Preview和Mythos 5大致相似,内部使用率相对较低且呈下降趋势,预计不会对外部署。
Claude Mythos 5是否公开发布?
并非普遍可用。Mythos 5通过Project Glasswing等受限可信访问计划提供,而Claude Fable 5使用相同的基础模型,但带有更强的安全防护措施,并且广泛可用。
相关工具
- Claude:Anthropic面向消费者和专业人士的通用AI助手。
- Claude API:Anthropic为普遍可用的Claude模型提供的开发者平台。
- Anthropic Console:用于测试Claude API模型和管理开发者访问权限的官方工作空间。
- Project Glasswing:Anthropic针对高级Mythos级网络安全能力的可信访问计划。
- Anthropic Transparency Hub:模型安全评估、系统卡片和风险信息的中央资源。
相关链接
- Anthropic 2026年8月风险报告:披露Model 1、Model 2、CoBench、内部使用情况和当前发布计划的主要来源。
- Claude Fable 5和Claude Mythos 5:Anthropic解释这两个模型之间关系的官方发布公告。
- Claude模型概览:Anthropic已发布模型的当前官方可用性和API信息。
- Claude Mythos:关于Mythos 5可用性、安全防护、定价和Project Glasswing的官方信息。
- Anthropic负责任扩展政策:Anthropic定期风险报告流程背后的治理框架。
- Anthropic Transparency Hub:当前Claude模型的官方安全与能力信息。
摘要
Anthropic的2026年8月风险报告揭示了一个名为Model 2的内部模型,该模型已经
目前正大量用于研究、工程、编码、数据生成以及持久化智能体工作流。
该模型在Anthropic内部CoBench评估中强于Claude Mythos 5,得分分别为62.8%和50.3%。Anthropic还表示,Model 2整体上似乎略强一些,尽管在某些领域弱于Mythos 5,且提升幅度远小于此前的重大能力跃升。
报告还提到了Model 1,但证据不足以支持将Model 1和Model 2视为已确认的公开产品序列。Model 1的内部使用量正在下降,而Anthropic明确表示目前没有对外发布Model 2的计划。
最明确的结论是,Anthropic的内部前沿水平已经略微超越了Mythos 5——但Model 2是内部研究系统,而非已发布的下一代Claude产品。



