Zurück zur Übersicht
Nemotron VoiceChat verbindet Sprachverstehen, Sprachmodell und Sprachausgabe in einer Architektur. Das Modell soll Unterbrechungen, Reaktionen in Echtzeit und Werkzeugaufrufe während laufender Gespräche ermöglichen.
NVIDIA hat mit Nemotron VoiceChat ein offenes Sprachmodell für sprachbasierte KI-Agenten vorgestellt. Die 11-Milliarden-Parameter-Version verarbeitet Spracheingabe, Sprachmodellierung und Sprachausgabe in einer gemeinsamen Architektur, statt dafür drei getrennte Dienste zu kombinieren.
Das Modell unterstützt Vollduplex-Gespräche. Es kann während der eigenen Antwort weiter zuhören, Unterbrechungen verarbeiten und nach Angaben von NVIDIA auf NVIDIA-GPUs mit weniger als einer Sekunde Verzögerung arbeiten. Auch Werkzeugaufrufe während eines laufenden Gesprächs sind vorgesehen.
Für den breiten Einsatz ist Nemotron VoiceChat noch nicht ausgereift. Die verfügbare Dokumentation weist auf eine Nutzung zu Forschungszwecken hin, zudem setzt der lokale Betrieb leistungsfähige Hardware voraus. Der relevante Fortschritt liegt damit zunächst in der Architektur: Sprachagenten rücken technisch näher an ein durchgängiges Gespräch, bleiben praktisch aber vorerst ein Forschungsprojekt.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
OpenAI wird Ankerkunde für zwei geplante KI-Rechenzentren des australischen Infrastrukturunternehmens Firmus. Dadurch steigt die vertraglich gebundene Gesamtkapazität von Firmus auf mehr als 900 Megawatt.
Samsung Electronics führt die Finanzierungsrunde an. Die Bewertung des französischen KI-Unternehmens steigt auf mehr als 21 Milliarden Euro.
Der KI Cloud Anbieter Nscale und der Roboterhersteller Figure planen eine mehrjährige Partnerschaft für das Training humanoider Roboter. Dafür könnten bis zu 100.000 GPUs der Nvidia Vera Rubin Plattform eingesetzt werden.
Nvidia will die Open Source Plattform Hugging Face übernehmen. Der Abschluss soll in der ersten Hälfte des Jahres 2027 erfolgen und steht noch unter dem Vorbehalt regulatorischer Genehmigungen.