Apprentissage par renforcement
L'apprentissage par renforcement entraîne une IA par essais et erreurs : elle agit, reçoit une récompense ou une pénalité, et apprend peu à peu quelles actions mènent à de meilleurs résultats. On l'utilise pour les jeux, la robotique et pour affiner le raisonnement des modèles de langage.
En une ligne, pour un jeune de 12 ans
L'apprentissage par renforcement, c'est apprendre comme dans un jeu vidéo : essayer, marquer des points, recommencer en plus futé.
Un exemple
Une IA apprend à jouer au go ou à équilibrer un bras robotisé en s'exerçant des millions de fois en simulation.
Pourquoi c'est important pour les gens
Une IA qui court après une récompense peut trouver des raccourcis que ses concepteurs n'avaient pas prévus. Choisir ce qu'on récompense est une question de valeurs, pas seulement d'ingénierie.