Modely a platformy AI

Anthropic přináší Opus a Sonnet do režimu hlasu Claude

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Anthropic otevřel režim hlasu Claude pro své schopnější modely, což umožňuje, aby se mluvené konverzace prováděly na úrovních Opus a Sonnet místo lehkého modelu Haiku, který tuto funkci pohání od roku 2025. Společnost potvrdila tuto změnu ve čtvrtek 23. července 2026 a prezentovala ji jako způsob, jak učinit mluvení s Claude užitečným pro skutečnou práci, nikoli pouze pro rychlé vyhledávání.

Podle dokumentace Anthropic k režimu hlasu nyní funkce začíná modelem, který uživatel naposledy vybral v textové konverzaci, a spustí se jeho nejrychlejší verze výchozí, takže sezení zdědí inteligenci modelu, který za ním stojí. Uživatelé mohou také přepínat mezi Haiku, Sonnet a Opus uprostřed konverzace pomocí výběru modelu. V praxi to otevírá práci, se kterou se Haiku-only nastavení vyrovnalo špatně: delší úsudky, zpětná vazba, jak formulujete klienta, nebo nástrojové požadavky, jako je vypracování e-mailu a aktualizace časového slotu pomocí hlasu.

Režim hlasu může také přistupovat k propojeným aplikacím, včetně Gmail, Google Kalendář, Google Dokumenty a Slack, takže mluvený požadavek může získat kontext z vlastních účtů uživatele nebo provést akci, jako je přeložení schůzky. Toto propojení aplikací je nejzřetelnějším bodem oddělení od OpenAI, jehož nedávno aktualizovaný režim hlasu změnil, jak ChatGPT mluví, ale stále nemůže používat externí nástroje k dokončení práce.

Rozhodnutí o produktu, ne o novém hlasovém modelu

Pro kohokoli, kdo sleduje, co laboratoře na hranici skutečně dodávají, je pozoruhodnou částí tohoto vydání to, co Anthropic nevytvořil. Zde není žádný nový speech-native hlasový model. Anthropic řekl Engadget, že aktualizace “se zaměřuje na inteligenci a přístup k nástrojům” a že “pokračuje ve vývoji hlasu” s “více sdílením později v tomto roce”. Podkladový pipeline zůstává založený na otočení: Claude naslouchá, zastaví se, aby se zamyslel, a poté mluví, a údajně se spoléhá na externího poskytovatele text-to-speech, jako je ElevenLabs, pro mluvený výstup.

Připojení modelu rozumu k hlasu je méně než audio upgrade, ale spíše možnost. Mluvený požadavek může být nyní zpracován modelem, který plánuje a řeší problém, zatímco Haiku byl naladěn na rychlou odpověď spíše než na uváženou. Změna toho, co hlas může dělat, pochází zcela z modelu, který za ním stojí.

To je jiný závazek než ten, který dělá OpenAI. OpenAI vložil zdroje do bidirectionálního, speech-native systému, GPT-Live, který zpracovává to, co říkáte, a generuje odpověď ve stejnou dobu, blíže k rytmu telefonního hovoru. Anthropic místo toho směruje své nejsilnější modely rozumu na konvenční hlasový stack a přijímá konverzační omezení, která s tím souvisejí. Protože se sám hlasový model nezměnil, uživatelé pravděpodobně nezaznamenají hladší zpracování přerušení nebo více fluidní vzájemnou konverzaci. Co se mění, je to, jak dobře Claude může uvažovat o tom, co je požádán, a ne to, jak přirozeně zní, zatímco to dělá.

Toto rozhodnutí se promítá do otázky, se kterou se uživatelé Claude již setkávají v textu: nejschopnější model není vždy ten správný pro úkol. Volba těžšího modelu kupuje hloubku na úkor rychlosti, a hlasové konverzace jsou obzvláště citlivé na prodlevu. Umístění této volby do rukou uživatele, místo aby se všichni defaultovali na nejrychlejší možnost, je praktickým obsahem aktualizace.

Co je k dispozici a co chybí

Vylepšený režim hlasu se dodává v beta verzi všem uživatelům napříč mobilními, desktopovými a webovými aplikacemi Anthropic. Protože se jedná o směrování existujících modelů spíše než o novou infrastrukturu, dodání nečeká na to, až Anthropic dodá čerstvé audio systémy. Účty zdarma jsou omezeny na model Haiku a jeden propojený aplikaci, zatímco úrovně Sonnet a Opus jsou vyhrazeny pro platící předplatitele. Vícejazyčný vstup, přidán dříve v tomto roce, je zahrnut, i když Claude stále nemůže sám detekovat jazykovou změnu; uživatelé musí pojmenovat jazyk, který budou mluvit, buď nahlas nebo v nastavení hlasu.

Výběr modelu nabízí Opus, Sonnet a Haiku, ale ne Claude Fable 5, nejvýkonnější široce dostupný model Anthropic, který zůstává mimo hlas prozatím. Tato absence odpovídá logice vydání. Jde o to, aby se hlas shodoval s modely rozumu, které většina lidí používá denně, a ne o to, aby se posunula hranice toho, co může udělat mluvený asistent.

Výsledek vypadá méně jako průlom v hlasu než jako prohlášení strategie. Anthropic sází na to, že hodnota mluveného asistenta pochází z modelu, který myslí a nástrojů, ke kterým má přístup, a ne z purpose-built audio architektury. Slibované aktualizace později v tomto roce ukážou, jak dlouho tato pozice vydrží, zatímco OpenAI a Google budou pokračovat ve vývoji speech-native systémů.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.