멜버른 대학교와 UNSW 연구진은 VoxMem을 소개합니다. 이는 현재 음성 AI 메모리 평가의 심각한 결함을 드러내는 새로운 벤치마크입니다. 오디오의 뉘앙스를 무시하던 기존 방법과 달리, VoxMem은 대화 길이를 분리하여 34,743개의 오디오 인스턴스에 걸쳐 화자 신원, 어조, 배경 소음에 대한 기억력을 테스트합니다. 15개 주요 모델을 테스트한 결과, 32K 컨텍스트 길이에서 정확도가 40%를 초과하는 모델은 없었습니다. 모델들은 부언어적 단서와 환경 소음 처리에 크게 어려움을 겪었으며, 이력 길이가 증가함에 따라 성능이 저하되었습니다. 이는 장문 오디오 이해 능력에서 큰 격차가 있음을 보여줍니다.





집
