La nouvelle méthode de formation de l'IA de Google aide les petits modèles à aborder un raisonnement complexe
Des chercheurs de Google Cloud et de l'UCLA ont proposé un nouveau cadre d'apprentissage par renforcement qui améliore considérablement la capacité des modèles de langage à apprendre des tâches de raisonnement en plusieurs étapes très difficiles. Apprentissage par renforcement supervisé (SRL) reformule la résolution de problèmes comme une séquence d’« actions » logiques, fournissant de riches signaux…
Détails




