Qwen3.8-LiveTranslate 2.3초 지연 시간의 실시간 번역 모델 출시
Qwen3.8-LiveTranslate는 알리바바 Qwen의 최신 실시간 음성 번역 모델로, 통합 인터리브(Interleave) 아키텍처를 통해 동시 통역을 재정의합니다. 이 혁신은 정확성, 유창성, 간결성을 향상시켜 문자당 평균 지연 시간(LAAL)을 2.8초에서 2.3초로 줄였으며, 이는 약간의 지연도 흐름을 방해할 수 있는 분야에서 자연스러운 청취 경험을 보장하는 중요한 0.5초 개선 사항입니다.
60개 언어에 대한 지원을 확장한 이 업데이트된 모델은 실시간 통역을 위해 세 가지 실용적인 기능을 추가했습니다. 첫째, 실시간 화자 분리를 지원하여 각 문장을 올바른 화자에게 정확히 할당하면서도 안정적인 음성 복제를 유지함으로써 교차 대화나 화자 혼동을 방지합니다. 둘째, 원문과 번역문을 나란히 표시하여 청취자가 번역을 들으면서 시각적으로 따라갈 수 있도록 합니다. 셋째, 긴 문맥의 모호성 해소를 강화하여 모델이 이전 문맥을 활용하여 정확도를 높일 수 있도록 하며, 이는 특히 이름과 전문 용어와 같은 오류가 자주 발생하는 영역에서 중요합니다.

Qwen3.8-LiveTranslate의 핵심은 하이브리드 MoE(Mixture of Experts)를 기반으로 한 ‘생각하기(Thinker)’와 ‘말하기(Talker)’의 이중 모듈 설계입니다. 인터리브 메커니즘은 스트리밍 이해, 텍스트 생성, 음성 합성을 단일 파이프라인에 원활하게 통합합니다. ‘생각하기’ 모듈은 비디오, 오디오, 원문 및 번역 출력을 하나의 인과적 시퀀스로 처리하여 시간순으로 정렬함으로써 ‘이해’와 ‘번역’을 동시에 처리하는 엔드투엔드 결과를 생성합니다. 이어 ‘말하기’ 모듈은 원본 오디오의 가이드에 따라 번역된 텍스트를 소스 화자의 음성 정체성을 보존하는 음성에 변환합니다.

관련 기사
OpenAI, 128K 컨텍스트를 위한 프라이버시 필터를 여덟 가지 인식 모드로 공개
OpenAI는 차세대 개인식별정보(PII) 익명화 모델인 Privacy Filter을 출시했습니다. 이제 Hugging Face와 GitHub에서 Apache 2.0 라이선스 하에 사용 가능한 이 도구는 강력한 프라이버시 보호를 위한 로컬이며 높은 커스터마이징이 가능한 솔루션을 개발자에게 제공합니다.규칙 기반 매칭을 넘어선 고급 의미론적 이해기존의 규칙 기반 도구와 달리 Privacy Filter은 맥락에 기반하여 비정형 텍스트 내의 민감한 데
NewCore, AI 에이전트에 신원 부여를 위해 직원 역할로 전환하는 데 필요한 자금을 6600만 달러 조달
사이버보안 스타트업 뉴코어(NewCore)가 공식적으로 스테ルス 모드를 벗어났으며, 월요일에 6,600만 달러의 자금을 조달했습니다. 이 회사는 AI 에이전트를 통합하는 과정에서 많은 조직이 곧 직면하게 될 중요한 과제를 해결하는 것을 목표로 합니다. 즉, 이러한 디지털 근로자들을 대규모로 어떻게 인증하고, 거버넌스를 적용하며, 통제할 것인가 하는 문제입니다.이번 시드 라운드는 사이버보안 전문 벤처캐피탈인 사이버스타츠(Cyberstarts)가
마이크로소프트와 미스트랄, 수십억 달러 규모의 유럽 AI 파트너십 체결
이번 협력의 핵심은 유럽 전역의 인공지능 인프라를 강화하기 위해 마련된 수십억 달러 규모의 협약이다. 출처: 마이크로소프트마이크로소프트와 프랑스의 선도적인 인공지능 기업 미스트랄(Mistral)은 유럽의 AI 생태계를 강화하기 위한 수십억 달러 규모의 파트너십을 발표했다.마이크로소프트와 프랑스의 첨단 대규모 언어 모델 개발사인 미스트랄(Mistral)은 유
관련 특별 주제 추천
의견 (0)
0/500
Qwen3.8-LiveTranslate는 알리바바 Qwen의 최신 실시간 음성 번역 모델로, 통합 인터리브(Interleave) 아키텍처를 통해 동시 통역을 재정의합니다. 이 혁신은 정확성, 유창성, 간결성을 향상시켜 문자당 평균 지연 시간(LAAL)을 2.8초에서 2.3초로 줄였으며, 이는 약간의 지연도 흐름을 방해할 수 있는 분야에서 자연스러운 청취 경험을 보장하는 중요한 0.5초 개선 사항입니다.
60개 언어에 대한 지원을 확장한 이 업데이트된 모델은 실시간 통역을 위해 세 가지 실용적인 기능을 추가했습니다. 첫째, 실시간 화자 분리를 지원하여 각 문장을 올바른 화자에게 정확히 할당하면서도 안정적인 음성 복제를 유지함으로써 교차 대화나 화자 혼동을 방지합니다. 둘째, 원문과 번역문을 나란히 표시하여 청취자가 번역을 들으면서 시각적으로 따라갈 수 있도록 합니다. 셋째, 긴 문맥의 모호성 해소를 강화하여 모델이 이전 문맥을 활용하여 정확도를 높일 수 있도록 하며, 이는 특히 이름과 전문 용어와 같은 오류가 자주 발생하는 영역에서 중요합니다.

Qwen3.8-LiveTranslate의 핵심은 하이브리드 MoE(Mixture of Experts)를 기반으로 한 ‘생각하기(Thinker)’와 ‘말하기(Talker)’의 이중 모듈 설계입니다. 인터리브 메커니즘은 스트리밍 이해, 텍스트 생성, 음성 합성을 단일 파이프라인에 원활하게 통합합니다. ‘생각하기’ 모듈은 비디오, 오디오, 원문 및 번역 출력을 하나의 인과적 시퀀스로 처리하여 시간순으로 정렬함으로써 ‘이해’와 ‘번역’을 동시에 처리하는 엔드투엔드 결과를 생성합니다. 이어 ‘말하기’ 모듈은 원본 오디오의 가이드에 따라 번역된 텍스트를 소스 화자의 음성 정체성을 보존하는 음성에 변환합니다.

OpenAI, 128K 컨텍스트를 위한 프라이버시 필터를 여덟 가지 인식 모드로 공개
OpenAI는 차세대 개인식별정보(PII) 익명화 모델인 Privacy Filter을 출시했습니다. 이제 Hugging Face와 GitHub에서 Apache 2.0 라이선스 하에 사용 가능한 이 도구는 강력한 프라이버시 보호를 위한 로컬이며 높은 커스터마이징이 가능한 솔루션을 개발자에게 제공합니다.규칙 기반 매칭을 넘어선 고급 의미론적 이해기존의 규칙 기반 도구와 달리 Privacy Filter은 맥락에 기반하여 비정형 텍스트 내의 민감한 데
NewCore, AI 에이전트에 신원 부여를 위해 직원 역할로 전환하는 데 필요한 자금을 6600만 달러 조달
사이버보안 스타트업 뉴코어(NewCore)가 공식적으로 스테ルス 모드를 벗어났으며, 월요일에 6,600만 달러의 자금을 조달했습니다. 이 회사는 AI 에이전트를 통합하는 과정에서 많은 조직이 곧 직면하게 될 중요한 과제를 해결하는 것을 목표로 합니다. 즉, 이러한 디지털 근로자들을 대규모로 어떻게 인증하고, 거버넌스를 적용하며, 통제할 것인가 하는 문제입니다.이번 시드 라운드는 사이버보안 전문 벤처캐피탈인 사이버스타츠(Cyberstarts)가
마이크로소프트와 미스트랄, 수십억 달러 규모의 유럽 AI 파트너십 체결
이번 협력의 핵심은 유럽 전역의 인공지능 인프라를 강화하기 위해 마련된 수십억 달러 규모의 협약이다. 출처: 마이크로소프트마이크로소프트와 프랑스의 선도적인 인공지능 기업 미스트랄(Mistral)은 유럽의 AI 생태계를 강화하기 위한 수십억 달러 규모의 파트너십을 발표했다.마이크로소프트와 프랑스의 첨단 대규모 언어 모델 개발사인 미스트랄(Mistral)은 유





집






