Expérience 03
Avatar bipède
Un corps articulé et un réseau de neurones qui ne savent d'abord rien apprennent, ensemble et sans supervision, à se tenir debout puis à avancer — un signal de récompense à la fois.
Qu'est-ce que l'apprentissage par renforcement ?
Ici, aucune trajectoire de marche n'est écrite nulle part. LifeLabs place un corps articulé — un torse, deux cuisses, deux jambes, deux pieds, sept segments physiques simulés par le moteur MuJoCo — et un réseau de neurones vide dans un monde avec de la gravité. Ce réseau ne connaît d'abord rien du tout : ni comment tenir debout, ni ce qu'« avancer » veut dire. À chaque pas, il choisit les forces à appliquer aux articulations, observe ce qui se passe, et reçoit un unique nombre en retour — une récompense — qui combine rester en vie, avancer, et dépenser le moins d'effort possible.
L'algorithme d'apprentissage, PPO (Proximal Policy Optimization), ajuste ensuite les poids du réseau pour rendre plus probables les actions qui ont mené à une récompense plus haute, et moins probables celles qui ont précédé une chute. Répété des dizaines de milliers de fois, ce seul signal suffit à faire apparaître une politique de contrôle : d'abord des spasmes incohérents, puis un équilibre qui tient de plus en plus longtemps, puis — avec assez de temps d'entraînement — une démarche. Rien de tout cela n'est écrit dans le code : le code se contente de noter un score et de corriger des poids.
Progression capturée aux checkpoints
À intervalles réguliers pendant l'entraînement, une vidéo du comportement courant de l'agent est enregistrée. Voici les checkpoints du dernier run publié, dans l'ordre — le même agent, de plus en plus expérimenté :
Un apprentissage individuel, pas une émergence collective
Chez les agents évolutifs (palier 3), c'est une population entière qui change de génération en génération : aucun agent individuel n'apprend au cours de sa propre vie, c'est la sélection qui fait progresser le groupe d'une génération à la suivante. Ici, c'est l'inverse : un seul agent, une seule politique, qui s'améliore au fil d'une seule et même vie simulée — l'apprentissage par renforcement ajuste directement les poids d'un réseau à partir de sa propre expérience, sans notion de génération ni de reproduction.
Chez Lenia, l'émergence produit une forme : une règle locale, identique partout et qui ne change jamais, fait apparaître une créature mobile et cohérente. Ici, c'est l'inverse : c'est la règle elle-même — les poids du réseau — qui change constamment, parce que c'est elle qui est apprise. Ce n'est donc pas, à proprement parler, de l'émergence, mais un apprentissage — et pour une fois, le mot est employé au sens technique exact : le réseau ajuste ses propres paramètres pour améliorer un score. Cela ne dit rien de la conscience de l'avatar : un ensemble de poids qui minimise une fonction de coût n'a pas d'expérience subjective connue.
Piloter
Rejeu 3D d'une démarche
Le rejeu ci-dessous reconstruit, image par image, les positions et orientations réelles de chacun des sept segments du corps enregistrées pendant un rollout — les mêmes données physiques que celles utilisées pour produire les vidéos de checkpoints ci-dessus, recalculées en 3D dans votre navigateur plutôt que pré-rendues en vidéo.
Chargement de la trajectoire…
Glisser pour orbiter la caméra, molette pour zoomer.
Le rejeu 3D n'a pas pu être chargé
La trajectoire 3D de ce run n'a pas pu être récupérée (ou WebGL n'est pas disponible dans ce navigateur). En attendant, voici une capture vidéo du dernier checkpoint entraîné, quand elle est disponible.
Les signes vitaux mesurés
Chaque run enregistre trois séries temporelles, calculées à chaque rollout d'entraînement, qui servent de « signes vitaux » à l'apprentissage :
- Récompense moyenne par épisode
- la récompense moyenne obtenue par épisode — elle combine rester en vie, avancer et limiter l'effort ; sa progression est le signal le plus direct que l'agent apprend, bien avant que cela ne se traduise en distance parcourue.
- Longueur d'épisode
- le nombre moyen de pas de simulation avant la fin d'un épisode (typiquement une chute) — une longueur d'épisode qui grimpe signale un agent qui apprend à rester debout plus longtemps, la toute première compétence acquise.
- Distance parcourue (x)
- la distance parcourue par le torse le long de l'axe x — le signal le plus tardif à progresser : un avatar apprend d'abord à survivre, et seulement ensuite à avancer.