Sprach-KI soll künftig ohne Cloud direkt auf dem PC laufen: Deepgram optimiert sein Speech-to-Text-Modell Nova-3 für Snapdragon-Prozessoren von Qualcomm. Das soll Echtzeit-Sprachanwendungen mit geringerer Latenz, höherem Datenschutz und mehr Zuverlässigkeit ermöglichen.
Deepgram hat angekündigt, seine Spracherkennungstechnologie für PCs mit Snapdragon-Prozessoren verfügbar zu machen. Dazu optimiert das Unternehmen sein Speech-to-Text-Modell Nova-3 für die Qualcomm Hexagon NPU der Snapdragon-X-Serie. Entwickler und Gerätehersteller sollen damit Echtzeit-Sprachanwendungen mit höherer Geschwindigkeit, mehr Datenschutz und größerer Zuverlässigkeit bereitstellen können, ohne auf eine Cloud-Verbindung angewiesen zu sein. Die Optimierung soll zudem den Einsatz von Sprachfunktionen in Anwendungen für Fahrzeuge, Mobilgeräte, KI-PCs, XR, industrielle Edge-Systeme, IoT-Geräte und Wearables erleichtern.
Bisher basierten viele Sprach-KI-Lösungen auf einer Cloud-Architektur. Bevor eine Antwort ausgegeben werden konnte, musste das Audiosignal das Gerät verlassen, in die Cloud übertragen, dort verarbeitet und anschließend an das Gerät zurückgesendet werden. Dieses Verfahren kann zu Verzögerungen führen und Datenschutzfragen aufwerfen, wodurch sich der Einsatz von Sprach-KI in bestimmten Anwendungen einschränken kann. Deepgram verlagert die Spracherkennung direkt auf das Endgerät. Nach Unternehmensangaben eröffnet dies neue Anwendungsmöglichkeiten und Nutzererlebnisse, die sich wie ein natürliches Gespräch anfühlen – unabhängig davon, ob sie im Fahrzeug, auf einem KI-PC, in einem XR-Headset oder am Netzwerkrand ohne gesicherte Konnektivität genutzt werden.
»Wir wissen, dass Sprach-KI-Technologien unterschiedliche Anforderungen erfüllen müssen. Deshalb schätzen wir die Zusammenarbeit mit Deepgram, denn Genauigkeit, Latenz, Zuverlässigkeit und Skalierbarkeit sind für Entwickler von Fahrzeugsystemen, Anwendungen im Gesundheitswesen, Industrielösungen und anderen sicherheitskritischen Anwendungen entscheidend«, sagte Upendra Kulkarni, Vice President Product Management bei Qualcomm Technologies.
»Die Zukunft der ‚Voice-First‘-Interaktion besteht darin, Nutzer dort abzuholen, wo sie sich gerade befinden – im Fahrzeug, in der Fabrikhalle, in einem XR-Headset –, ohne dabei Kompromisse bei Genauigkeit oder Reaktionsgeschwindigkeit einzugehen«, sagte Abe Pursell, Vice President für Geschäftsentwicklung und Partnerschaften bei Deepgram. »Dafür ist eine Spracherkennung auf Unternehmensniveau erforderlich, die auch unter den Einschränkungen eines Endgeräts arbeitet. Mit Deepgram Nova-3 bringen wir diese Technologie direkt auf PCs mit Snapdragon und schaffen eine Grundlage für Sprachfunktionen, die unabhängig von den jeweiligen Netzwerkbedingungen genutzt werden können.«
Nova-3 baut die laut eigenen Angaben branchenführende Genauigkeit von Deepgram weiter aus und erweitert seine Fähigkeiten auf ein breiteres Spektrum realer Anwendungsfälle in Unternehmen sowie auf anspruchsvolle Audiobedingungen. Es sei das erste Sprach-KI-Modell, das mehrsprachige Transkription in Echtzeit bietet. Deepgram sei außerdem das erste Unternehmen, das Nutzern nachweislich effektive und hochpräzise Selbstbedienungs-Anpassungsmöglichkeiten bietet – dies ermöglicht eine sofortige Anpassung des Vokabulars ohne erneutes Training des Modells. Deepgram gibt an, dass Nova-3 mit einer Wortfehlerrate von 6,89 Prozent bei realen Audiodaten die höchste Transkriptionsgenauigkeit erreiche. Dies entspreche einer um 24,7 Prozent niedrigeren Fehlerrate als beim nächstbesten Wettbewerber.