Fermez le navigateur : les agents continuent de travailler
Aujourd'hui, les agents sont passés d'une « fenêtre dans laquelle vous discutez » à des « collègues qui fonctionnent longtemps en arrière-plan » : fermer la fenêtre ou abandonner le réseau ne les arrête pas, et la réouverture reprend là où vous vous étiez arrêté ; plusieurs onglets de conversation s'exécutent simultanément sans diaphonie ; un tableau de bord local examine chaque tâche ; plusieurs backends de codage partagent un protocole et peuvent être échangés à tout moment ; et le moteur a acquis un vocabulaire unifié d'actifs de handle et de GUID.
De "fermez la fenêtre et elle s'arrête" à "vit en arrière-plan"
Avant cela, la vie d'un agent était liée au navigateur : fermez l'onglet et le processus d'arrière-plan effectuant le travail s'arrêtait avec lui – une longue tâche à moitié terminée en un instant. C’est un obstacle fondamental à « laisser l’IA faire des choses pour vous au fil du temps » : qui lui confierait une tâche qui dure des dizaines de minutes et n’oserait pas ensuite fermer l’ordinateur portable ou interrompre le réseau pendant toute la durée ? La ligne directrice de ce jour consistait à "dissocier" l'agent du navigateur, ce qui en faisait un collègue d'arrière-plan indépendant et persistant vers lequel vous pouvez revenir à tout moment. C'est un changement mental : de « je garde une fenêtre ouverte pour le regarder discuter » à « je confie le travail, je vais faire autre chose et je reviens au résultat ».
Les agents survivent à une fenêtre fermée et reprennent
L'essentiel de ce travail est de conserver chaque tâche exécutée dans un enregistrement sur le disque, avec un index. De cette façon, le processus de l'agent ne dépend plus de la connexion frontale pour rester en vie : la déconnexion du navigateur ne fait que couper la ligne « observation » ; la ligne "de travail" continue de fonctionner en arrière-plan. Lorsque vous rouvrez, le frontal se reconnecte avec un marqueur indiquant « l'endroit où j'ai vu pour la dernière fois », remplit la sortie que vous avez manquée pendant votre absence, puis rejoint le flux en direct toujours en cours. Lors des tests ce jour-là, une réponse de plus de dix mille caractères – qui n'a fini d'être générée qu'après le rechargement de la page – a été rendue intégralement lors de cette actualisation, sans qu'un mot ne manque. Derrière cela se cache une conception de flux d'événements « reprenant » : chaque événement a un numéro de séquence, et lors de la reconnexion, il récupère à partir de votre dernier numéro, sans rien perdre ni dupliquer rien.
Onglets de conversation simultanés, sans diaphonie
Étant donné que les agents peuvent désormais fonctionner longtemps en arrière-plan, vous devriez naturellement pouvoir en ouvrir plusieurs à la fois. Aujourd'hui, l'interface prend en charge plusieurs onglets de conversation : un plus en haut ouvre une nouvelle session, vous pouvez donc avoir un agent exécutant une longue tâche dans cet onglet tout en discutant avec un autre agent sur autre chose dans un autre, sans interrompre l'autre. Le changement d'onglet n'interrompt aucune exécution en arrière-plan ; l'état et le flux de chacun restent proprement séparés. Pour la vision d'« une personne dirigeant une équipe d'IA », les onglets simultanés constituent le point d'entrée le plus intuitif : transformant « faire avancer plusieurs choses à la fois » d'un concept en quelque chose que vous faites avec désinvolture, et ouvrant la voie à une véritable collaboration multi-agents plus tard.
Un tableau de bord local : présentation, exécutions, sessions, utilisation
Avec des tâches exécutées en arrière-plan et plusieurs ouvertes en même temps, vous avez besoin d’un endroit pour examiner l’ensemble. Cette journée a ajouté un tableau de bord local en haut à droite avec quatre vues : vue d'ensemble pour une vue d'ensemble, tâches en cours d'exécution pour ceux qui sont encore en cours, sessions pour les conversations passées et analyse d'utilisation pour la consommation. Ici, vous pouvez annuler ou supprimer des tâches et regarder le flux de sortie de n'importe quelle tâche défiler caractère par caractère en direct. Sa valeur est un sentiment de contrôle : lorsque vous avez laissé plusieurs tâches longues en arrière-plan, vous avez besoin d'un tableau de bord pour savoir à tout moment où en est chacune, si quelque chose s'est mal passé et combien cela a coûté. Intégrer cette « vue des opérations » dans le produit signifie que la plate-forme ne veut pas seulement que vous « fassiez une chose avec l'IA », mais prenne au sérieux la réalité selon laquelle « vous gérerez plusieurs choses à la fois ».
Plusieurs backends de codage, un protocole, échangeables à tout moment
Plusieurs « backends de codage » peuvent piloter un agent, et chacun diffère légèrement en termes de format d'événement, de capacité et de stabilité. Cette journée a intégré un autre nouveau backend et les a tous unifiés sous un seul protocole de flux d'événements : quel que soit le fournisseur sous-jacent, le front-end voit les mêmes événements ordonnés, de sorte que l'interface et le flux sont identiques. L'avantage le plus pratique : lorsqu'un logiciel est temporairement indisponible ou peu performant, vous pouvez passer à un autre en un clic sans distorsion de l'interface, des opérations ou de l'expérience. Faire de « quel modèle de backend » un choix enfichable transparent pour les couches supérieures protège les utilisateurs contre le verrouillage d'un seul fournisseur et permet à la plate-forme d'intégrer sereinement de plus en plus de backends sans réécrire l'interface pour chacun.
Moteur : un vocabulaire unifié de descripteurs et de ressources GUID
Le moteur a réalisé aujourd'hui une convergence importante dans son "vocabulaire conceptuel" de bas niveau. Les actifs ont reçu des identifiants globalement uniques (GUID) et un format de disque adressé par ceux-ci, ce qui signifie que chaque actif a une identité qui ne peut pas être confondue, référençable avec précision dans les projets et les scènes. La conception de type « poignée » a été clarifiée en parallèle, caractérisant une référence selon deux dimensions afin que les références soient à la fois sûres et clairement exprimées. Le moteur a également modifié « l'instanciation », passant d'un traitement par lots automatique implicite à une déclaration explicite : vous dites clairement au moteur "il s'agit d'un lot du même objet à rassembler", ce qui rend le comportement plus contrôlable et prévisible. Il s'agit d'une ingénierie invisible de bas niveau, mais elle décide si le moteur reste clair et ordonné à mesure que le contenu se développe et que les scènes deviennent complexes – doter les actifs d'un système d'identité fiable est la condition préalable à tout « importation, réutilisation, composition » ultérieure.
Jeux stockés par projet + un correctif d'actualisation par rechargement à chaud
Cette journée a également modifié la manière dont le contenu du jeu est stocké : de la « publication unifiée » à « chaque projet conserve sa propre copie », les données du jeu résidant dans le propre répertoire de cette instance. C'est plus intuitif : votre jeu appartient à votre projet et n'est pas publié dans un pool partagé. Un problème persistant de rechargement à chaud a été résolu en parallèle : auparavant, dans certaines configurations proxy, l'aperçu ne s'actualisait pas vraiment après un rechargement du navigateur, car le canal de rechargement à chaud se connectait au mauvais port ; ce jour, le problème a été corrigé afin que "modifier et voir" reste stable sur les chemins de déploiement. De tels ajustements semblent insignifiants, mais constituent la garantie sous-jacente de savoir si « construire en parlant » reste soyeux du début à la fin.
Ce que signifie cette journée
Le changement le plus important de cette journée a été l'identité de l'agent : il ne s'agit plus d'un interlocuteur de discussion qui "n'existe que pendant que vous regardez", mais d'un collègue en arrière-plan qui travaille de manière indépendante, est interrogé et géré, et peut être rappelé à tout moment. Survit à une fenêtre fermée, s'exécute simultanément, est gérable via un panneau, backends remplaçables - ensemble, ceux-ci poussent « demander à l'IA de faire les choses pour vous » d'un scénario de démonstration à une véritable façon de travailler. Vous pouvez confier plusieurs tâches à différents agents à la fois, fermer l'ordinateur portable et faire autre chose, puis revenir et les accepter une par une. C’est exactement ce que veut être la plateforme : non pas un jouet que vous devez surveiller en permanence, mais une équipe à laquelle vous pouvez confier et auprès de laquelle vous pouvez revenir récupérer. La véritable collaboration multi-agents à venir repose sur les fondations « persistantes + concurrentes + observables » posées aujourd'hui.