Forge Labs
Toutes les publications

IA appliquée aux entreprises

GPT-Live : quand l’IA devient un collègue en temps réel

Avec GPT-Live, la voix devient une interface vers des agents capables de déléguer, de poursuivre une tâche et de solliciter une décision. Notre perspective chez Forge Labs.

7 octobre 20269 minRédaction Forge Labs
Illustration de l’article : GPT-Live : quand l’IA devient un collègue en temps réel

GPT-Live permet de converser avec une IA en temps réel pendant qu’un système d’agents poursuit le travail demandé. Pour Forge Labs, l’intérêt dépasse la voix : cette interface ouvre une autre manière de travailler avec son système d’information, en confiant des tâches à des agents capables d’utiliser des outils, de déléguer et de revenir vers l’utilisateur lorsqu’une décision devient nécessaire.

Ce passage du chatbot au collègue numérique est une évolution du mode d’interaction. Il ne donne pas à l’IA les responsabilités d’un humain et ne supprime pas les contrôles. Il change le point d’entrée : au lieu de chercher le bon logiciel, l’utilisateur peut solliciter l’agent qui sait où chercher et quelles actions il est autorisé à préparer ou à exécuter.

Cette analyse expose notre direction de recherche et développement au 7 octobre 2026. Les dialogues présentés sont des scénarios illustratifs ; les possibilités multicanales décrites constituent une cible de travail, pas l’annonce d’un produit entièrement livré.

Du chatbot à l’agent : confier un travail, pas seulement une question

Pendant longtemps, parler à une intelligence artificielle revenait essentiellement à ajouter une interface vocale devant un chatbot : une voix est transcrite, un modèle produit une réponse, un moteur de synthèse la lit. Cette chaîne reste utile, mais elle conserve souvent une logique de demande et de réponse.

Humain → demande → IA → réponse.

Les modèles vocaux directs rendent cette interaction plus naturelle. L’évolution qui nous intéresse concerne aussi ce qui se passe derrière la conversation :

Humain ↔ agent ↔ outils ↔ système d’information.

L’agent ne se contente plus de produire du texte. Selon les autorisations accordées, il peut consulter une messagerie, rechercher une information dans un ERP, analyser un document, préparer une réponse, suivre une tâche ou solliciter une validation humaine.

On ne demande plus seulement : « Que dois-je faire ? » On peut dire : « Occupe-toi de ça et reviens vers moi si tu as besoin d’une décision. » Cette différence nous paraît plus structurante que la seule amélioration des performances d’un modèle. Pour préciser les termes, notre publication sur la différence entre un agent IA et un chatbot complète cette lecture.

Ce que GPT-Live change dans une conversation en temps réel

GPT-Live est une technologie d’OpenAI, annoncée le 8 juillet 2026. Elle associe la conversation vocale en temps réel à la délégation vers un agent chargé du raisonnement et de l’usage des outils. La présentation officielle de GPT-Live et le guide technique OpenAI décrivent ce fonctionnement.

Une conversation fluide demande de gérer les interruptions, les silences, la reprise de parole et la latence. Elle demande aussi de laisser une opération se poursuivre sans obliger l’utilisateur à attendre en silence. GPT-Live peut écouter pendant qu’il parle, ce qui aide à gérer les interruptions et la reprise de parole. Le dialogue et le travail peuvent alors avancer en parallèle.

Imaginons cet échange avec Estelle, l’un de nos agents :

— Estelle, est-ce que la banque nous a répondu ?
— Oui. Une réponse est arrivée ce matin. Ils demandent deux documents complémentaires.
— On les a ?
— J’en ai retrouvé un. Le second semble manquer.
— Demande-le à la comptabilité et prépare-moi la réponse.

Dans ce scénario, l’utilisateur n’a pas besoin de connaître le dossier de messagerie, l’emplacement des documents ou l’outil de suivi. La conversation devient l’interface. Le système doit néanmoins vérifier les documents retrouvés et appliquer les règles d’envoi. Une demande orale ne constitue pas, à elle seule, une autorisation universelle d’agir.

Estelle : un agent auquel on peut déjà parler en langage naturel

Chez Forge Labs, nous expérimentons depuis plusieurs mois des architectures d’agents capables d’interagir avec nos outils internes. Nous leur donnons des identités et des responsabilités définies. L’un de ces agents s’appelle Estelle.

Aujourd’hui, nous pouvons déjà lui demander en langage naturel : « Estelle, est-ce que j’ai reçu un mail de la banque ? » Cette demande paraît banale. Elle implique pourtant de comprendre l’intention, sélectionner les capacités utiles, interroger les ressources autorisées, récupérer l’information pertinente et restituer une réponse exploitable.

Nous travaillons maintenant à supprimer une autre contrainte : l’obligation d’aller chercher l’agent pour lui parler. Notre cible est une interface proche d’une messagerie classique, dans laquelle l’agent peut recevoir un message et revenir vers l’utilisateur au sujet d’un travail en cours.

« J’ai terminé l’analyse des trois propositions. Deux sont cohérentes. J’ai un doute sur une exclusion dans la troisième. Souhaites-tu que je poursuive l’analyse ou que je la mette de côté ? »

Ce second scénario illustre une interaction asynchrone : l’utilisateur répond lorsqu’il le souhaite, puis l’agent reprend la tâche. Nous cherchons ainsi à combiner le dialogue immédiat et le travail qui se poursuit entre deux échanges. GPT-Live ajoute la conversation vocale temps réel à cette architecture.

Travailler sans monopoliser la conversation

Certaines opérations prennent quelques secondes. D’autres exigent plusieurs minutes, attendent une réponse d’un autre système ou dépendent d’un événement extérieur. Maintenir la conversation bloquée pendant tout ce temps n’a aucun sens.

Nous séparons donc plusieurs responsabilités. De manière volontairement simplifiée :

Conversation → orchestration → agents → outils.

GPT-Live peut constituer l’une des interfaces conversationnelles. Derrière cette interface, notre infrastructure organise les tâches et les échanges entre agents et outils. Le modèle chargé de maintenir une conversation naturelle n’a pas nécessairement vocation à réaliser lui-même tout le travail demandé : il peut déléguer, tandis que l’utilisateur continue à parler.

Il faut distinguer la capacité de délégation et son encadrement. Comme le précise la documentation OpenAI sur la délégation, l’application conserve la responsabilité des permissions, des confirmations, des règles métier et de l’état des tâches. GPT-Live ne remplace pas cette infrastructure.

Nous ne détaillons pas ici nos mécanismes internes de routage, de persistance et de gestion du contexte. Cette couche constitue une partie importante de notre R&D. Le principe public est simple : le travail doit pouvoir continuer, être suivi et reprendre sans dépendre de la durée d’un appel.

La voix est une interface parmi d’autres

Nous cherchons à rendre le canal secondaire. À terme, un même agent devrait pouvoir être contacté par messagerie, par la voix, depuis une application métier ou par téléphone.

Une conversation pourrait commencer par écrit le matin, continuer vocalement plus tard et reprendre dans une application professionnelle. L’identité de l’agent et le travail en cours resteraient les mêmes. Cette continuité multicanale est un objectif de conception.

Elle ne repose pas sur une mémoire illimitée du modèle. L’application doit conserver les informations importantes, l’état du travail et les décisions nécessaires à la reprise, comme le rappelle le guide OpenAI sur les conversations. Savoir quoi conserver compte autant que savoir quoi transmettre à l’agent.

Ce choix change notre manière de concevoir les interfaces. Aujourd’hui, effectuer une opération commence souvent par retrouver le logiciel correspondant. Demain, nous pourrions d’abord solliciter l’agent capable d’orchestrer les outils utiles.

L’interface graphique peut perdre son rôle de point d’entrée obligatoire

Pour rechercher une donnée dans un ERP, l’utilisateur doit généralement connaître les menus, les filtres et l’organisation du logiciel. Un agent connecté pourrait recevoir la question, consulter le système puis présenter l’information et sa provenance.

Aujourd’hui : ERP → interface → utilisateur → recherche → information.
La cible : utilisateur → agent → ERP.

Les interfaces graphiques restent nécessaires pour visualiser, comparer, contrôler ou réaliser une opération complexe. Mais elles peuvent devenir un espace auquel l’agent nous conduit lorsque le besoin l’exige, plutôt que le passage obligé de chaque tâche.

L’agent forme alors une couche d’accès au système d’information. Sa qualité se mesure aussi à sa capacité à montrer d’où vient une réponse, à signaler une incertitude et à ouvrir le bon écran lorsque la conversation ne suffit plus.

Quand l’agent prend l’initiative, les autorisations deviennent décisives

Un chatbot attend généralement une demande. Un système d’agents peut être conçu pour surveiller certains événements : dossier incomplet, échéance proche, réponse attendue ou tâche qui nécessite une décision humaine.

« J’ai terminé la préparation du dossier. Il me manque ton accord sur le montant avant de poursuivre. »

Le rapprochement avec un collègue tient à ce mode d’interaction : confier un travail, recevoir un point d’avancement, arbitrer une difficulté puis laisser la tâche reprendre. Il ne signifie pas que l’IA devient humaine ou qu’elle peut engager l’entreprise sans contrôle.

Un agent qui prend l’initiative doit rester dans un périmètre défini. Consulter une information, préparer un courriel et envoyer ce courriel sont trois actions distinctes. Une autorisation accordée pour la première ne doit pas être interprétée comme une permission pour les deux autres. Notre analyse sur l’automatisation des processus de validation développe cet enjeu de responsabilité.

Le vrai sujet reste l’orchestration

Nous pensons qu’une part importante de la valeur des systèmes d’agents se jouera dans leur orchestration. Comment choisissent-ils leurs outils ? Comment délèguent-ils ? Comment retrouvent-ils le contexte pertinent plusieurs heures plus tard ? Comment collaborent-ils sans perdre les décisions déjà prises ?

Ces questions déterminent si une démonstration peut devenir une infrastructure exploitable. Pour évaluer un système, nous commencerions par un travail précis, puis vérifierions cinq points :

  • L’accès : l’agent ne consulte que les ressources nécessaires à cette tâche.
  • L’action : les opérations autorisées sont définies séparément des opérations qui exigent une confirmation.
  • L’attente : une opération longue ou interrompue possède un état consultable et peut reprendre.
  • La décision : l’agent restitue ce qui manque, ce qui reste incertain et l’arbitrage attendu.
  • La preuve : le système distingue une action préparée, une action exécutée et un résultat effectivement vérifié.

Un agent peut dire « c’est fait » alors qu’il a seulement envoyé une requête. La fiabilité demande de vérifier le résultat dans le système concerné et de garder une trace compréhensible. Pour aller plus loin sur cette couche, lire comment construire un assistant connecté aux données de l’entreprise.

Une nouvelle phase pour le logiciel professionnel

Après la ligne de commande, l’interface graphique, le Web et le mobile, les agents pourraient former une nouvelle couche d’interaction. Dans cette vision, nous passons moins de temps à naviguer entre des logiciels et davantage de temps à travailler avec des agents qui savent les utiliser.

GPT-Live rend cette évolution perceptible en ajoutant une conversation immédiate et naturelle. Mais la voix est la partie visible. Derrière elle se trouvent les outils, les permissions, les tâches persistantes, les mécanismes de délégation et les vérifications nécessaires au travail fiable.

C’est cette infrastructure que nous explorons chez Forge Labs. Notre conviction est simple : la prochaine génération de logiciels ne se contentera pas d’attendre que nous les utilisions. Elle travaillera avec nous.

Sources techniques OpenAI consultées le 7 octobre 2026. Les analyses, les objectifs de R&D et les exemples de conception présentés ici expriment la perspective de Forge Labs.