Inherent, un laboratoire d'IA britannique fondé par d'anciens de DeepMind, affirme que son agent Faraday a surpassé les modèles d'Anthropic et d'OpenAI sur un benchmark mesurant la réplication autonome d'articles scientifiques — la capacité à lire une étude et à reproduire ses résultats de manière indépendante.\n\n## Points clés\n\n- Faraday d'Inherent est un agent IA — un système qui prend des actions multi-étapes de manière autonome, pas seulement un générateur de texte — conçu spécifiquement pour répliquer la recherche scientifique.\n- Dans le propre benchmark d'Inherent, Faraday a surpassé les modèles d'Anthropic et d'OpenAI sur la tâche de réplication de recherche.\n- Inherent a été fondé par d'anciens de Google DeepMind, lui donnant un pedigree de recherche dans les systèmes d'IA autonomes.\n- La réplication de recherche est considérée comme un test significatif de la profondeur de raisonnement : elle nécessite de comprendre la méthodologie, pas seulement de résumer les conclusions.\n- Les résultats du benchmark sont ceux d'Inherent ; aucune vérification indépendante par un tiers n'a encore été rapportée.\n\n## Ce que teste réellement la réplication de recherche\n\nRépliquer un article scientifique n'est pas la même chose que le résumer. Un modèle capable de répliquer une étude doit analyser la méthodologie, identifier les variables, exécuter ou simuler le processus décrit, et produire des résultats qui correspondent à l'original dans une marge acceptable. Pensez-y comme à la différence entre lire une recette et réellement cuisiner le plat correctement. Cette distinction compte pour quiconque utilise l'IA pour assister avec des flux de travail créatifs ou techniques structurés et multi-étapes — la même profondeur de raisonnement qui permet à un agent de reproduire une expérience est ce qui lui permettrait de suivre de manière fiable une chaîne de prompts complexe ou d'exécuter un pipeline de production sans dériver.\n\nPour les créateurs d'art IA, le parallèle immédiat est les flux de travail agentiques : des systèmes qui exécutent des séquences d'étapes de génération, d'évaluation et de raffinement sans supervision constante. Plus la capacité d'un agent à maintenir une tâche structurée en tête à travers de nombreuses étapes est forte, plus il gère de manière fiable des choses comme la correspondance de style itérative, l'exécution de prompts par lots, ou le raffinement d'image multi-passes.\n\n## Performance de Faraday sur le benchmark et ce qu'il faut croire\n\nSelon TechCrunch, Inherent positionne Faraday comme un « coéquipier » IA plutôt qu'un outil — le présentant comme quelque chose qui travaille aux côtés des chercheurs plutôt que de simplement traiter leurs demandes. Les résultats du benchmark montrant Faraday devant les offres d'Anthropic et d'OpenAI sont, à ce stade, les propres chiffres d'Inherent. Aucune évaluation indépendante par un tiers n'a été publiée, ce qui est une réserve standard à garder à l'esprit quand une startup annonce avoir battu des acteurs établis mieux connus.\n\nCela dit, le pedigree d'anciens de DeepMind n'est pas cosmétique. L'équipe a une expérience directe de la construction du type de systèmes d'apprentissage par renforcement et de planification qui sous-tendent les agents capables, et la réplication de recherche est une cible plus difficile que la plupart des tâches de classement parce qu'elle pénalise sévèrement l'hallucination — un modèle qui invente un résultat plutôt que de le reproduire échoue immédiatement.\n\n## Pourquoi le cadrage « coéquipier » signale quelque chose de spécifique\n\nLe choix d'Inherent du mot « coéquipier » plutôt qu'« assistant » ou « outil » est délibéré. Il implique un système qui prend l'initiative sur les sous-tâches, vérifie son propre travail, et fait remonter l'incertitude plutôt que de la dissimuler. Ce profil comportemental — s'il résiste aux tests indépendants — serait genuinement utile dans des contextes créatifs où le mode d'échec des agents actuels est l'erreur confiante : un modèle qui génère une sortie d'apparence plausible qui rate discrètement l'objectif.\n\nLe cadrage de réplication de recherche positionne aussi Faraday directement dans l'espace de l'IA agentique où des laboratoires comme Anthropic (avec les fonctionnalités d'utilisation d'ordinateur de Claude) et OpenAI se livrent une concurrence acharnée. Un laboratoire plus petit revendiquant une avance de benchmark dans cette capacité spécifique est un signal que le niveau agentique de l'IA devient genuinement disputé, pas une course à deux chevaux.\n\nPour les créateurs explorant les outils d'IA au-delà de la génération d'images — utilisant des agents pour automatiser la collecte de références, l'analyse de style, ou l'itération de prompts — l'annonce de Faraday vaut la peine d'être suivie. La question pratique est de savoir si Inherent ouvre l'accès largement ou garde Faraday dans un modèle de partenaire de recherche. Aucune date de sortie publique ou tarification n'a été annoncée. Jusqu'à ce qu'une réplication indépendante du benchmark de réplication apparaisse, le chiffre principal est une affirmation, pas un verdict — mais c'est une affirmation spécifique et falsifiable, ce qui est plus que ce qu'offrent la plupart des benchmarks de startups.\n\nLes créateurs expérimentant déjà avec des flux de travail assistés par IA peuvent explorer ce que supportent les outils de génération actuelle sur les guides de Charmloop pendant que le niveau agentique des modèles continue de se développer.