Microsoft는 MAI-Transcribe-2를 공개했으며, 이는 지금까지 가장 정확한 음성 인식 모델로, 시간당 단 0.67위안으로 60개 언어를 지원합니다.
Microsoft는 MAI-Transcribe-2를 출시하며, 이를 업계에서 가장 빠르고 정확하며 비용 효율적인 AI 음성-텍스트 변환 솔루션으로 포지셔닝했습니다. 시간당 $0.10(약 0.67위안)의 프로모션 가격으로 제공되며, 이 혜택은 2026년 말까지 유효합니다.

뛰어난 정확성과 속도: GPT-Transcribe보다 10배 빠름
FLEURS 데이터셋에 대한 성능 벤치마킹 결과, MAI-Transcribe-2는 강제 언어 모드와 자동 감지 모드 모두에서 평균 단어 오류율(WER) 5.2%를 달성했습니다. 비교 대상인 Gemini 3.1 Pro는 각각 5.3%, 5.8%를 기록했으며, GPT-Transcribe는 10.4%, 10.6%를 보였고, Whisper v3-Large는 22.8%, 23.5%를 기록했습니다.
처리 속도와 관련하여 Microsoft는 Artificial Analysis의 데이터를 인용하여 MAI-Transcribe-2가 GPT-Transcribe보다 10배 빠르고, Scribe v2보다 7배 빠르며, Gemini 3.5 Transcribe보다 5배 빠르다고 밝혔습니다.
고급 기능: 화자 분리, 타임스탬프 및 60개 언어 지원
주요 기능으로는 녹음 파일 내 고유한 음성을 식별하고 해당 텍스트를 올바른 화자에게 할당하는 화자 분리 기능이 있습니다. 단어 단위 타임스탬프를 통해 정밀한 오디오 탐색, 편집 및 자막 동기화가 가능합니다.
사용자는 전사 스타일을 사용자 정의할 수 있습니다: 법적 또는 분석적 정확성을 위해 불필요한 단어와 오류를 그대로 유지하는 'verbatim 모드'와 가독성 있는 메모 및 자막을 위해 이를 제거하는 'clean 모드'가 있습니다. 이 모델은 키워드 편향, 자동 언어 감지, 동적 언어 전환, 그리고 소음이 많은 환경에서의 견고한 성능도 지원합니다. 60개 언어를 지원하며, 미리 지정된 언어 설정 없이도 혼합 언어 대화를 원활하게 처리합니다.
개발자는 Microsoft Foundry, MAI Playground, OpenRouter를 통해 모델에 접근하거나 테스트할 수 있습니다.
관련 기사
텐센트, 하이엔 하이4 모델 규모 두 배로 확대하며 AI 추진 가속화, 모건스탠리 목표가 HKD 550로 상향 조정
텐센트는 후안위안 Hy4의 미리보기판을 공식적으로 공개하여 모건스탠리의 9월 예측보다 앞당겨진 일정을 가속화하고, 연내 모델 출시를 약속한 2분기 실적 발표의 약속을 이행했습니다. 2025년 4분기 야오순위(Yao Shunyu)를 최고 AI 과학자로 임명 이후, 텐센스는 모델 반복을 크게 가속화했습니다. 4월 Hy3 미리보기판과 7월 공식 Hy3 출시 이후, Hy4 미리보기판의 조기 도착은 원래 4분기에 예정되었던 공식 출시가 예상보다 더 빨리
피어슨의 데이브 트리트: AI는 학습을 이끌어야지, 속여서는 안 된다
피어슨의 최고기술책임자(CTO), 데이브 트리트학문적 정직성, AI 도입, 그리고 자율적 AI가 교육을 변화시키는 가운데 중요한 핵심 역량에 대하여데이브 트리트(Dave Treat)는 약 2년 전 피어슨에 최고기술책임자(CTO)로 합류한 후, 이후 최고정보책임자(CIO) 직책을 맡아 회사의 전체 기술 포트폴리오를 총괄해 왔다.이번 인사는 그가 성장해 온 분
OpenAI, GPT-5.6-Cyber 출시, AI 자동화를 통한 제로데이 취약점 탐지 강화
OpenAI는 Daybreak 사이버 보안 이니셔티브를 확대하여 2단계 접근 시스템을 도입하고 보안 운영을 위해 특별히 설계된 GPT-5.6-Cyber 모델을 출시했습니다. 이 조치는 위협 행위자들이 전례 없는 속도와 규모로 공격을 실행하기 위해 AI를 활용한다는 증가하는 현실에 대응하며, 효과적인 방어의 시간을 drastically 줄이고 있습니다. 광범위한 악의적 배포 이전에 신뢰할 수 있는 방어자들에게 고급 AI 도구를 제공함으로써 Ope
관련 특별 주제 추천
의견 (0)
0/500
Microsoft는 MAI-Transcribe-2를 출시하며, 이를 업계에서 가장 빠르고 정확하며 비용 효율적인 AI 음성-텍스트 변환 솔루션으로 포지셔닝했습니다. 시간당 $0.10(약 0.67위안)의 프로모션 가격으로 제공되며, 이 혜택은 2026년 말까지 유효합니다.

뛰어난 정확성과 속도: GPT-Transcribe보다 10배 빠름
FLEURS 데이터셋에 대한 성능 벤치마킹 결과, MAI-Transcribe-2는 강제 언어 모드와 자동 감지 모드 모두에서 평균 단어 오류율(WER) 5.2%를 달성했습니다. 비교 대상인 Gemini 3.1 Pro는 각각 5.3%, 5.8%를 기록했으며, GPT-Transcribe는 10.4%, 10.6%를 보였고, Whisper v3-Large는 22.8%, 23.5%를 기록했습니다.
처리 속도와 관련하여 Microsoft는 Artificial Analysis의 데이터를 인용하여 MAI-Transcribe-2가 GPT-Transcribe보다 10배 빠르고, Scribe v2보다 7배 빠르며, Gemini 3.5 Transcribe보다 5배 빠르다고 밝혔습니다.
고급 기능: 화자 분리, 타임스탬프 및 60개 언어 지원
주요 기능으로는 녹음 파일 내 고유한 음성을 식별하고 해당 텍스트를 올바른 화자에게 할당하는 화자 분리 기능이 있습니다. 단어 단위 타임스탬프를 통해 정밀한 오디오 탐색, 편집 및 자막 동기화가 가능합니다.
사용자는 전사 스타일을 사용자 정의할 수 있습니다: 법적 또는 분석적 정확성을 위해 불필요한 단어와 오류를 그대로 유지하는 'verbatim 모드'와 가독성 있는 메모 및 자막을 위해 이를 제거하는 'clean 모드'가 있습니다. 이 모델은 키워드 편향, 자동 언어 감지, 동적 언어 전환, 그리고 소음이 많은 환경에서의 견고한 성능도 지원합니다. 60개 언어를 지원하며, 미리 지정된 언어 설정 없이도 혼합 언어 대화를 원활하게 처리합니다.
개발자는 Microsoft Foundry, MAI Playground, OpenRouter를 통해 모델에 접근하거나 테스트할 수 있습니다.
텐센트, 하이엔 하이4 모델 규모 두 배로 확대하며 AI 추진 가속화, 모건스탠리 목표가 HKD 550로 상향 조정
텐센트는 후안위안 Hy4의 미리보기판을 공식적으로 공개하여 모건스탠리의 9월 예측보다 앞당겨진 일정을 가속화하고, 연내 모델 출시를 약속한 2분기 실적 발표의 약속을 이행했습니다. 2025년 4분기 야오순위(Yao Shunyu)를 최고 AI 과학자로 임명 이후, 텐센스는 모델 반복을 크게 가속화했습니다. 4월 Hy3 미리보기판과 7월 공식 Hy3 출시 이후, Hy4 미리보기판의 조기 도착은 원래 4분기에 예정되었던 공식 출시가 예상보다 더 빨리
피어슨의 데이브 트리트: AI는 학습을 이끌어야지, 속여서는 안 된다
피어슨의 최고기술책임자(CTO), 데이브 트리트학문적 정직성, AI 도입, 그리고 자율적 AI가 교육을 변화시키는 가운데 중요한 핵심 역량에 대하여데이브 트리트(Dave Treat)는 약 2년 전 피어슨에 최고기술책임자(CTO)로 합류한 후, 이후 최고정보책임자(CIO) 직책을 맡아 회사의 전체 기술 포트폴리오를 총괄해 왔다.이번 인사는 그가 성장해 온 분
OpenAI, GPT-5.6-Cyber 출시, AI 자동화를 통한 제로데이 취약점 탐지 강화
OpenAI는 Daybreak 사이버 보안 이니셔티브를 확대하여 2단계 접근 시스템을 도입하고 보안 운영을 위해 특별히 설계된 GPT-5.6-Cyber 모델을 출시했습니다. 이 조치는 위협 행위자들이 전례 없는 속도와 규모로 공격을 실행하기 위해 AI를 활용한다는 증가하는 현실에 대응하며, 효과적인 방어의 시간을 drastically 줄이고 있습니다. 광범위한 악의적 배포 이전에 신뢰할 수 있는 방어자들에게 고급 AI 도구를 제공함으로써 Ope





집






