Heim
NVIDIA stellt das einheitliche Audio-Intelligenzmodell Nemotron-Labs-Audex-30B-A3B vor

Während multimodale große Modelle rasch voranschreiten, werden die Fähigkeiten zur Audiobearbeitung häufig beeinträchtigt – viele Modelle verbessern das Audioverständnis auf Kosten der Textlogik. Um dies zu adressieren, haben NVIDIA-Forscher Nemotron-Labs-Audex-30B-A3B (Audex) eingeführt, ein einheitliches Audio-Text-Großes Sprachmodell, das darauf ausgelegt ist, diese Lücke zu schließen.
Audex verwendet ein schlankes und effizientes Design, das auf einer robusten reinen Text-Mixture-of-Experts-(MoE)-Architektur basiert. Durch die Nutzung eines einzigen Transformer-Decoders verarbeitet es Text und quantisierte Audiokenne gleichzeitig. Dieser Ansatz projiziert Audioeingaben in den Text-Embedding-Raum und gewährleistet so eine nahtlose Integration in bestehende LLM-Infrastrukturen für multimodale Aufgaben sowie eine echte tiefe Integration.
Das Training umfasste umfangreiche Datensätze mit 157,4 Milliarden Audiokennen und 320,5 Milliarden Texttoken. Durch mehrstufiges überwachtes Training, reinen Text-Cascade-Verstärkungslernen und wissensbasierte Wissensdistillation in mehreren Domänen erreicht Audex branchenführende Leistungen im Audioverständnis, Spracherkennung, Übersetzung und Generierung. Entscheidend ist, dass es die Kernfähigkeiten des ursprünglichen LLMs in Bezug auf Schlussfolgerung, Ausrichtung, Wissensabruf und Langtextverarbeitung mit minimaler Beeinträchtigung bewahrt.
Als Open-Source-Modell markiert Audex einen bedeutenden Meilenstein für den Bereich der Sprachtechnologie. Jenseits theoretischer Forschung bietet es eine ausgereifte Lösung für Entwickler, um direkt zu evaluieren und bereitzustellen. Für diejenigen, die komplexe Audiointeraktionen verwalten, bietet Audex eine ausgewogene Option, die die Leistung verbessert und gleichzeitig neue Wege für die Forschung zur multimodalen Intelligenz eröffnet.
Verwandter Artikel
Fireworks AI stellt FireRouter mit Opus vor: Reduziert die Encodierungskosten um 57 % bei minimaler Genauigkeitsverlust
Fireworks AI hat FireRouter mit Opus eingeführt, das erste cache-bewusste Routing-System der Branche, das speziell für die Claude-Opus-Serie entwickelt wurde. Jetzt über einen serverlosen Endpunkt verfügbar, durchlief dieses unabhängige Routing-Model
Wie man Core Web Vitals für Mobile SEO behebt
Lokales SEO verbessern: Aufbau Ihrer Google-Entitäts-Cloud-Drive-StacksInhaltsverzeichnis:EinführungVerständnis von Google Entity Cloud StackingHauptvorteile von Google Entity Cloud StackingErste Schritte mit Google Entity Cloud Stacks 4.1. Opti
Moonshot AI sammelt über 3,5 Milliarden US-Dollar in der Serie F ein und erreicht eine Bewertung von 35 Milliarden US-Dollar.
Moonshot AIs Kimi hat erfolgreich seine Series-F-Finanzierungsrunde abgeschlossen und dabei mehr als 3,5 Milliarden US-Dollar gesichert, was einer Bewertung nach der Finanzierung von 35 Milliarden US-Dollar entspricht, wie Sci-Tech Daily berichtet.G
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Während multimodale große Modelle rasch voranschreiten, werden die Fähigkeiten zur Audiobearbeitung häufig beeinträchtigt – viele Modelle verbessern das Audioverständnis auf Kosten der Textlogik. Um dies zu adressieren, haben NVIDIA-Forscher Nemotron-Labs-Audex-30B-A3B (Audex) eingeführt, ein einheitliches Audio-Text-Großes Sprachmodell, das darauf ausgelegt ist, diese Lücke zu schließen.
Audex verwendet ein schlankes und effizientes Design, das auf einer robusten reinen Text-Mixture-of-Experts-(MoE)-Architektur basiert. Durch die Nutzung eines einzigen Transformer-Decoders verarbeitet es Text und quantisierte Audiokenne gleichzeitig. Dieser Ansatz projiziert Audioeingaben in den Text-Embedding-Raum und gewährleistet so eine nahtlose Integration in bestehende LLM-Infrastrukturen für multimodale Aufgaben sowie eine echte tiefe Integration.
Das Training umfasste umfangreiche Datensätze mit 157,4 Milliarden Audiokennen und 320,5 Milliarden Texttoken. Durch mehrstufiges überwachtes Training, reinen Text-Cascade-Verstärkungslernen und wissensbasierte Wissensdistillation in mehreren Domänen erreicht Audex branchenführende Leistungen im Audioverständnis, Spracherkennung, Übersetzung und Generierung. Entscheidend ist, dass es die Kernfähigkeiten des ursprünglichen LLMs in Bezug auf Schlussfolgerung, Ausrichtung, Wissensabruf und Langtextverarbeitung mit minimaler Beeinträchtigung bewahrt.
Als Open-Source-Modell markiert Audex einen bedeutenden Meilenstein für den Bereich der Sprachtechnologie. Jenseits theoretischer Forschung bietet es eine ausgereifte Lösung für Entwickler, um direkt zu evaluieren und bereitzustellen. Für diejenigen, die komplexe Audiointeraktionen verwalten, bietet Audex eine ausgewogene Option, die die Leistung verbessert und gleichzeitig neue Wege für die Forschung zur multimodalen Intelligenz eröffnet.
Fireworks AI stellt FireRouter mit Opus vor: Reduziert die Encodierungskosten um 57 % bei minimaler Genauigkeitsverlust
Fireworks AI hat FireRouter mit Opus eingeführt, das erste cache-bewusste Routing-System der Branche, das speziell für die Claude-Opus-Serie entwickelt wurde. Jetzt über einen serverlosen Endpunkt verfügbar, durchlief dieses unabhängige Routing-Model
Wie man Core Web Vitals für Mobile SEO behebt
Lokales SEO verbessern: Aufbau Ihrer Google-Entitäts-Cloud-Drive-StacksInhaltsverzeichnis:EinführungVerständnis von Google Entity Cloud StackingHauptvorteile von Google Entity Cloud StackingErste Schritte mit Google Entity Cloud Stacks 4.1. Opti
Moonshot AI sammelt über 3,5 Milliarden US-Dollar in der Serie F ein und erreicht eine Bewertung von 35 Milliarden US-Dollar.
Moonshot AIs Kimi hat erfolgreich seine Series-F-Finanzierungsrunde abgeschlossen und dabei mehr als 3,5 Milliarden US-Dollar gesichert, was einer Bewertung nach der Finanzierung von 35 Milliarden US-Dollar entspricht, wie Sci-Tech Daily berichtet.G











