OpenAI lance HealthBench, un référentiel d’évaluation des modèles d’IA en santé, basé sur 5 000 conversations simulées analysées par 262 médecins dans 60 pays. L’outil, multilingue et couvrant 26 spécialités, utilise des grilles comprenant 48 562 critères pour juger la pertinence des réponses selon des cas cliniques réalistes.