Kyutai, laboratoire français de recherche en intelligence artificielle, développe des modèles vocaux capables de dialoguer en temps réel, de traduire instantanément et de fonctionner sur des appareils plus modestes. Patrick Pérez explique comment un petit labo peut innover face aux géants de l’IA.

INTERVIEW : Patrick Pérez - Directeur général de Kyutai

Rediffusion du 29 octobre 2025

L'essentiel

  • Nous ne faisons pas de produit, nous sommes entièrement consacrĂ©s Ă  la recherche.
  • Moshi permet des interactions vocales plus naturelles entre l’humain et la machine.
  • La finalitĂ© de l’open source, c’est que d’autres s’en saisissent.
  • Nous avons fait des choses que d’autres n’avaient pas fait avant nous.

Comment Kyutai trouve-t-il sa place dans la course mondiale à l’intelligence artificielle face aux géants du secteur ?

Nous sommes un laboratoire de recherche à but non lucratif, financé par du mécénat privé. Notre objectif n’est pas de lancer des produits, mais de faire avancer la connaissance en développant des prototypes et en partageant les résultats, les modèles et le code. Même dans un domaine dominé par de très grandes organisations, il reste possible pour de petites équipes de faire émerger des innovations importantes.

Avec Moshi, vous avez développé une IA vocale capable de conversations très naturelles. Quelle était l’innovation principale ?

Moshi est un modèle conversationnel vocal qui permet une interaction sans tour de parole imposé. La machine peut couper la parole à bon escient, comme dans une vraie conversation. Pour y arriver, nous avons évité de passer par une transcription textuelle intermédiaire de la parole, ce qui permet d’aller plus vite et de conserver des informations importantes comme le timbre, l’émotion ou l’accent de la voix.

Vos travaux portent aussi sur la traduction simultanée et la synthèse vocale. Quels sont les prochains défis ?

Nous travaillons beaucoup sur des IA multimodales capables de rester fluides dans la conversation tout en ayant accès à des informations nouvelles, comme des documents, des vidéos ou des contenus audio. L’objectif est de créer des assistants qui peuvent comprendre différents types d’informations et interagir naturellement avec les utilisateurs.

Hébergé par Audiomeans. Visitez audiomeans.fr/politique-de-confidentialite pour plus d'informations.

Podden och tillhörande omslagsbild på den här sidan tillhör Jérôme Colombain. Innehållet i podden är skapat av Jérôme Colombain och inte av, eller tillsammans med, Poddtoppen.