Les benchmarks d'IA ignorent les désaccords humains, révèle Google
Une étude de Google Research révèle que les benchmarks d'IA ignorent systématiquement les désaccords humains. Les pratiques actuelles, avec trois à cinq évaluateurs par exemple, ne suffisent pas pour des résultats fiables.