AI News · 23 septembre 2026 · 5:14

OpenAI et le choc mathématique & Évaluateurs ChatGPT pris en faute - Actualités IA (23 sept. 2026)

OpenAI, Xiaomi, Meta, Anthropic, agents IA, open-weight et éthique : le tour d’horizon du 23 septembre 2026 à écouter en 5 minutes.

OpenAI et le choc mathématique & Évaluateurs ChatGPT pris en faute - Actualités IA (23 sept. 2026)
0:005:14

Our Sponsors

Today's AI News Topics

  1. OpenAI et le choc mathématique

    — OpenAI affirme qu’un nouveau modèle interne a déjà résolu plus de 100 problèmes mathématiques ouverts, dont Navier–Stokes, et crée un groupe consultatif indépendant. Mots-clés : OpenAI, mathématiques, Navier-Stokes, recherche, sécurité scientifique.
  2. Évaluateurs ChatGPT pris en faute

    — Des sous-traitants chargés d’évaluer ChatGPT auraient été écartés pour avoir utilisé des outils d’IA eux-mêmes. Mots-clés : OpenAI, annotation, qualité des données, supervision humaine, modèles.
  3. Modèles ouverts : poussée chinoise

    — Xiaomi publie MiMo-V2.6 et met en avant une progression par reinforcement learning, pendant qu’Alibaba annonce sa puce Zhenwu V900. Mots-clés : open-weight, Chine, Xiaomi, Alibaba, infrastructure IA.
  4. Mieux mesurer les agents IA

    — RecreationWorld propose un banc d’essai plus réaliste pour les agents capables de cliquer, coder et vérifier visuellement sur plusieurs plateformes. Mots-clés : agents IA, benchmark, GUI, Web, automatisation.
  5. Essaims d’agents, gains limités

    — Selon Toby Ord, les grands essaims d’agents améliorent surtout la vitesse, mais beaucoup moins l’intelligence que ce qu’on pourrait croire. Mots-clés : multi-agent, scaling, coût, parallélisation, performance.
  6. L’IA se découpe en briques

    — Plusieurs analyses décrivent un basculement vers des petits modèles spécialisés pour classer, vérifier et décider, au lieu d’envoyer chaque tâche à un LLM géant. Mots-clés : small models, routage, coût, inference, productivité.
  7. Muse décolle, Claude intrigue

    — Meta démarre fort avec Muse sur iPhone, tandis qu’Anthropic testerait discrètement un Claude plus fort en animations et mini-jeux JavaScript. Mots-clés : Meta, Muse, Claude, applications IA, adoption.
  8. Authenticité sous pression avec l’IA

    — Stanford est critiqué pour avoir retouché des photos étudiantes avec l’IA, tandis qu’une étude montre que les contenus web générés par IA laissent une signature structurelle détectable. Mots-clés : authenticité, images, détection IA, contenu synthétique, éthique.
  9. IA militaire et erreur tragique

    — Une enquête du Pentagone relie une frappe meurtrière en Iran à des renseignements erronés, des images périmées et une confiance excessive dans des outils d’aide au ciblage. Mots-clés : Pentagone, ciblage, IA militaire, erreur, responsabilité.

Sources & AI News References

Full Episode Transcript: OpenAI et le choc mathématique & Évaluateurs ChatGPT pris en faute

Une IA qui aurait déjà attaqué plus de cent problèmes mathématiques ouverts, dont Navier–Stokes : c’est la nouvelle qui fait le plus lever les sourcils aujourd’hui. Bienvenue dans The Automated Daily, édition AI News. Le podcast créé par l’IA générative. Nous sommes le 23 septembre 2026, et voici les actus IA à retenir ce matin.

OpenAI et le choc mathématique

On commence avec OpenAI, qui dit avoir lancé fin août un nouveau modèle interne déjà capable de résoudre plus de cent problèmes mathématiques restés ouverts pendant des années, y compris le problème de Navier–Stokes. C’est une affirmation énorme, donc à prendre avec prudence, mais suffisamment sérieuse pour pousser l’entreprise à créer un groupe consultatif indépendant de mathématiciens. Ce qui compte ici, c’est moins l’effet d’annonce que le signal : les labos veulent désormais montrer que leurs modèles ne servent plus seulement à rédiger ou coder, mais à produire du travail scientifique inédit.

Évaluateurs ChatGPT pris en faute

Autre sujet chez OpenAI, beaucoup plus terre à terre : des sous-traitants chargés de relire et noter les réponses de ChatGPT auraient été retirés de projets après avoir utilisé des outils d’IA pour faire ce travail. L’ironie est évidente : des personnes censées apporter du jugement humain auraient parfois recyclé du texte généré. Pourquoi c’est important ? Parce que la qualité de l’entraînement dépend directement de la qualité de ces évaluations, et que si la boucle se referme sur de l’IA qui juge de l’IA, le risque de bruit et de dérive augmente.

Modèles ouverts : poussée chinoise

Dans la course aux modèles ouverts, la Chine continue de gagner du terrain. Xiaomi a publié MiMo-V2.6, une nouvelle famille omnidale qui insiste sur un point clé : de meilleurs retours pendant le reinforcement learning comptent autant, voire plus, que simplement multiplier les essais. En parallèle, un autre article souligne que les modèles open-weight chinois pèsent désormais lourd en usage réel et en adoption académique. Et Alibaba renforce encore cette dynamique avec une nouvelle puce, la Zhenwu V900, destinée à l’entraînement à grande échelle. Le message global est clair : la compétition ne se joue plus seulement sur les meilleurs modèles fermés, mais aussi sur l’écosystème ouvert, les puces et l’infrastructure.

Mieux mesurer les agents IA

Côté agents, un projet de recherche appelé RecreationWorld veut améliorer la manière dont on les évalue. L’idée est simple : au lieu de tester un agent sur des tâches abstraites, on lui demande de recréer une application en combinant interface graphique, code et vérification visuelle. Le tout fonctionne sur le Web, desktop et mobile. Pourquoi c’est intéressant ? Parce qu’on se rapproche enfin de scénarios qui ressemblent davantage à un vrai travail logiciel ou opérationnel, avec des résultats observables plutôt qu’un simple score de benchmark déconnecté du terrain.

Essaims d’agents, gains limités

Toujours sur les agents, le philosophe et chercheur Toby Ord s’est penché sur les grands essaims d’agents IA. Sa conclusion est nuancée : oui, faire travailler beaucoup d’agents en parallèle aide, mais avec des rendements décroissants assez marqués. En clair, ajouter des agents apporte surtout de la vitesse, pas une explosion de capacité à coût égal. C’est une bonne piqûre de rappel à un moment où beaucoup de démonstrations donnent l’impression que multiplier les agents suffit à multiplier l’intelligence.

L’IA se découpe en briques

Une autre tendance de fond se confirme : l’IA pourrait se fragmenter en briques spécialisées. Plusieurs analyses expliquent qu’au lieu d’envoyer chaque décision à un gros LLM coûteux, on va de plus en plus router les tâches simples vers des modèles plus petits, des classeurs, des rerankers ou des moteurs de décision dédiés. On voit aussi apparaître des alternatives locales comme Kev pour ce type d’usage structuré. Ce qui change, c’est l’économie du logiciel : l’application devient une sorte de chef d’orchestre qui choisit l’outil le moins cher et le plus adapté pour chaque micro-décision.

Muse décolle, Claude intrigue

Sur le front grand public, Meta a pris un départ très rapide avec son agent personnel Muse, brièvement numéro un des applications gratuites sur iPhone aux États-Unis. C’est un bon test pour savoir si le public veut vraiment d’un agent personnel au-delà de l’effet de nouveauté. En parallèle, Anthropic testerait discrètement une future version de Claude, remarquée pour des animations interactives et de petits jeux en JavaScript bien plus aboutis que d’habitude. Entre adoption grand public et tests silencieux en conditions réelles, la cadence reste très élevée.

Authenticité sous pression avec l’IA

La question de l’authenticité, elle, devient de plus en plus concrète. À Stanford, des critiques ont visé un service universitaire après l’utilisation d’IA pour modifier des photos d’étudiants dans des supports de communication, avec des changements de personnes et même d’apparence physique. Et dans un registre plus large, une étude affirme que le contenu commercial généré par IA peut être détecté non seulement par le style, mais par sa structure profonde, avec une précision très élevée. Autrement dit, même quand les mots changent, l’organisation du texte peut trahir l’origine synthétique. Pour les institutions, les marques et les plateformes, c’est un vrai sujet de confiance.

IA militaire et erreur tragique

On termine avec l’histoire la plus grave du jour. Une enquête du Pentagone conclut qu’une frappe américaine meurtrière sur une école en Iran a été favorisée par des renseignements erronés, des images satellite obsolètes et une confiance excessive dans des outils d’aide au ciblage assistés par IA. Le dossier rappelle brutalement une chose : dans les domaines à très haut risque, compresser les vérifications et survaloriser l’automatisation peut avoir des conséquences irréparables. L’enjeu n’est plus théorique, il est humain, juridique et politique.

C’est tout pour aujourd’hui. Merci d’avoir écouté The Automated Daily, édition AI News. On se retrouve très vite pour un nouveau point sur ce que l’IA change, concrètement. Et comme toujours, vous trouverez les liens vers toutes les histoires dans les notes de l’épisode.

More from AI News