Modèles et plateformes d’IA

Anthropic apporte Opus et Sonnet à Claude Voice Mode

mm
Ajouter Unite.AI à vos sources préférées sur Google

Anthropic a ouvert le mode vocal de Claude à ses modèles plus capables, permettant aux conversations parlées de s’exécuter sur les niveaux Opus et Sonnet au lieu du modèle Haiku léger qui a alimenté la fonctionnalité depuis son lancement en 2025. La société a confirmé le changement jeudi 23 juillet 2026, le présentant comme un moyen de rendre la conversation avec Claude utile pour un travail réel plutôt que pour des recherches rapides.

Selon la documentation du mode vocal d’Anthropic, la fonctionnalité commence maintenant avec le modèle que l’utilisateur a sélectionné pour la dernière fois dans le chat texte et exécute sa version la plus rapide par défaut, de sorte qu’une session hérite de l’intelligence du modèle qui se trouve derrière. Les utilisateurs peuvent également basculer entre Haiku, Sonnet et Opus au milieu d’une conversation à l’aide d’un sélecteur de modèle. Dans la pratique, cela ouvre des tâches que la configuration Haiku seule gérait mal : raisonnement plus long, commentaires sur la façon de formuler une proposition commerciale à un client, ou des demandes lourdes d’outils telles que la rédaction d’un e-mail et la mise à jour d’un créneau de calendrier par voix.

Le mode vocal peut également accéder à des applications connectées, notamment Gmail, Google Calendar, Google Docs et Slack, de sorte qu’une demande parlée peut extraire le contexte des comptes de l’utilisateur ou effectuer une action telle que la réorganisation d’une réunion. Cette intégration d’applications est le point de séparation le plus clair par rapport à OpenAI, dont le mode vocal mis à jour récemment a modifié la façon dont ChatGPT parle, mais ne peut toujours pas utiliser des outils externes pour accomplir des tâches.

Une décision de produit, et non un nouveau modèle vocal

Pour ceux qui suivent ce que les laboratoires de pointe livrent réellement, la partie notable de cette version est ce qu’Anthropic n’a pas construit. Il n’y a pas de nouveau modèle vocal natif de la parole ici. Anthropic a déclaré à Engadget que la mise à jour “se concentre sur l’intelligence et l’accès aux outils” et qu’elle “continue à investir dans la voix” avec “plus à partager plus tard cette année”. Le pipeline sous-jacent reste basé sur les tours : Claude écoute, pause pour réfléchir, puis parle, et il repose apparemment sur un fournisseur de texte-à-parole externe tel que ElevenLabs pour la sortie parlée.

Le routage d’un modèle de raisonnement vers la voix est moins une mise à niveau audio qu’une mise à niveau de capacité. Une demande parlée peut maintenant être traitée par un modèle qui planifie et travaille sur un problème, alors que Haiku était conçu pour renvoyer une réponse rapide plutôt qu’une réponse réfléchie. Le changement dans ce que la voix peut faire provient entièrement du modèle qui se trouve derrière.

C’est un pari différent de celui que OpenAI fait. OpenAI a consacré des ressources à un système bidirectionnel, natif de la parole, GPT-Live, qui traite ce que vous dites et génère une réponse en même temps, plus proche du rythme d’un appel téléphonique. Anthropic achemine plutôt ses modèles de raisonnement les plus solides vers une pile vocale conventionnelle et accepte les limites conversationnelles qui viennent avec. Puisque le modèle vocal lui-même est inchangé, les utilisateurs sont peu susceptibles de remarquer une gestion plus fluide des interruptions ou un va-et-vient plus fluide. Ce qui change, c’est à quel point Claude peut raisonner sur ce qui lui est demandé, et non à quel point il sonne naturellement en le faisant.

Le compromis se superpose à une question que les utilisateurs de Claude rencontrent déjà en texte : le modèle le plus capable n’est pas toujours le bon pour la tâche. Choisir un modèle plus lourd achète de la profondeur au prix de la vitesse, et les conversations vocales sont particulièrement sensibles à la latence. Mettre le choix entre les mains de l’utilisateur, plutôt que de faire défiler tout le monde vers l’option la plus rapide, est la substance pratique de la mise à jour.

Ce qui est disponible, et ce qui manque

Le mode vocal amélioré est déployé en version bêta pour tous les utilisateurs sur les applications mobiles, de bureau et Web d’Anthropic. Puisqu’il s’agit d’acheminer des modèles existants plutôt que de nouvelles infrastructures, le déploiement n’attend pas qu’Anthropic livre de nouveaux systèmes audio. Les comptes gratuits sont limités au modèle Haiku et à une application connectée, avec les niveaux Sonnet et Opus réservés aux abonnés payants. La saisie multilingue, ajoutée plus tôt cette année, est incluse, bien que Claude ne puisse toujours pas détecter un commutateur de langue par lui-même ; les utilisateurs doivent nommer la langue qu’ils sont sur le point de parler, soit à haute voix, soit dans les paramètres vocaux.

Le sélecteur expose Opus, Sonnet et Haiku, mais pas Claude Fable 5, le modèle le plus capable d’Anthropic largement disponible, qui reste hors de la voix pour le moment. Cette omission correspond à la logique de la version. Il s’agit de faire correspondre la voix aux modèles de raisonnement que la plupart des gens utilisent déjà au quotidien, et non de pousser les limites de ce qu’un assistant parlé peut faire.

Résultat, cela ressemble moins à une percée vocale qu’à une déclaration de stratégie. Anthropic mise sur le fait que la valeur d’un assistant parlé provient du modèle qui réfléchit et des outils auxquels il peut accéder, et non d’une architecture audio conçue à des fins spécifiques. Ses suites promises plus tard cette année montreront combien de temps cette position tiendra face aux systèmes de parole natifs que OpenAI et Google continuent de pousser.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.