人工智慧心理健康工具意外發現有效深度偽造檢測技術

隨著科技巨頭OpenAI於2025年9月推出旗艦級Sora 2影音生成模型,深度偽造影片已席捲社群媒體,使觀眾對潛在危害性的超寫實內容日漸習以為常。
儘管OpenAI強調將負責任地部署Sora 2作為核心目標——承諾提供用戶「管理資訊流內容的工具與選擇權」,並確保用戶對自身肖像擁有完全控制權——但2025年10月的研究顯示,該模型生成誤導性影片的比率高達80%。
從偽造摩爾多瓦選舉官員銷毀選票的假新聞片段,到虛構幼兒遭移民當局拘留的影像,乃至可口可樂發言人宣布公司將不贊助超級盃的偽造畫面,在這個高度互聯的世界中,虛假資訊的危害性已達空前高峰。
超越Sora:語音詐騙的崛起
早在OpenAI工具問世前,深度偽造內容的創作與傳播便已加速。網路安全公司DeepStrike於2025年9月發布的報告指出,此類內容從2023年的50萬起激增至2025年的800萬起,其中多數用於詐騙。
此趨勢未見緩解跡象;美國AI相關詐騙案預計將於2027年達到400億美元規模。
不僅數量激增,隨著Sora 2與Google Veo 3等工具問世,AI生成人臉、聲音及全身表演的逼真度更達前所未見。電腦科學家暨深度偽造專家呂思偉指出,現行模型能生成穩定無失真的面部影像,而聲音複製技術已達「難以辨別」的境界。
現實情況是,深度偽造技術的演進速度遠超檢測手段。科技公司主打的娛樂工具——用於創作奧運體操動作或豐富音頻背景——正被犯罪分子用於針對企業與個體的詐騙。僅2025年上半年,深度偽造詐騙就造成企業損失3.56億美元,個人損失達5.41億美元。
傳統的深度偽造檢測技術——如檢查水印、修圖痕跡及元數據——已顯力不從心。與此同時,語音深度偽造躍居第二大常見AI詐騙手段,2025年語音釣魚攻擊激增442%,影響範圍極廣。
呂博士指出:「如今僅需數秒音頻,便能生成具備自然語調、節奏、重音、情感、停頓甚至呼吸聲的逼真克隆人。」
傾聽人類之聲
健康科技新創公司Kintsugi開發人工智慧語音生物標記技術,用以識別臨床憂鬱與焦慮徵兆。其研究源於一個簡單理念:我們需要真正傾聽人們的心聲。
「創立金繼的契機源於親身經歷。當時我耗費近五個月反覆致電醫療機構,僅為預約首次治療,卻無人回電。我持續嘗試——但當時就想著:若是父親或兄弟遭遇此境,恐怕早已放棄。」執行長張玉琪向Unite.AI透露。
這家加州公司於2019年成立,旨在解決張所稱的「分流瓶頸」。她認為早期被動檢測病情嚴重程度,能幫助人們更快獲得適當治療。透過Kintsugi Voice技術,聲音生物標記可協助識別臨床抑鬱與焦慮症狀。
多項研究支持運用人工智慧驅動的語音分析作為心理健康生物標記。例如2025年5月發表的論文指出,聲學生物標記能偵測心理健康問題與神經差異的早期徵兆,並倡導在臨床環境中運用歌唱分析評估潛在認知衰退。
根據美國精神醫學會數據,語音分析技術在78%至96%的案例中能精準區分抑鬱症患者與非患者。另一項研究採用一分鐘詞彙流暢度測試(受試者需盡可能列舉特定類別詞彙),在偵測抑鬱與焦慮共病症例時,準確率達70%至83%。
為評估心理健康狀態,Kintsugi僅需收集簡短語音樣本。其聲紋生物標記技術能解析音高、語調、聲線及停頓等特徵——這些特徵與憂鬱症、焦慮症、躁鬱症及失智症密切相關。
張博士未曾預料的是,這項技術同時解決了安全領域的關鍵難題:精準辨識聲音是否真正源自人類。
從心理健康到網路安全
2025年末於紐約峰會期間,張女士向一位資安領域的朋友提及,其團隊對合成語音的測試成效不彰。
「我們試圖運用合成數據強化心理健康模型的訓練,但生成的聲音與真人語音差異過大,幾乎每次都能被識破,」她解釋道。
「他突然打斷我說:『葛蕾絲——這是資安領域的未解難題。』當下所有線索瞬間串聯起來。此後與資安、金融及電信企業的討論中,我們發現深度偽造語音攻擊正急速擴散——在即時通話中區分真人與合成聲音至關重要。」這位執行長補充道。
去年四月,聯邦調查局曾警示公眾:有惡意簡訊與語音詐騙活動假冒美國高階官員,鎖定前政府雇員及其聯絡人。美國主要銀行平均每日遭遇5.5次語音詐騙企圖,范德堡大學醫學中心員工更通報遭遇冒充友人、主管及同事的語音釣魚攻擊。
最初,深度偽造技術並非Kintsugi的關注重點。儘管團隊運用Cartesia、Sesame及ElevenLabs等模型為客服人員與工作流程模擬合成語音,但在充斥著Sora等普及工具的市場中,深度偽造詐騙並非優先考量。
然而,確認語音真實性的線索正是定義人類言語的生物標記。無論語言或內容為何,Kintsugi Voice皆透過分析訊號處理與物理發聲延遲,捕捉微妙的時序變化、韻律變化、認知負荷及生理特徵——著重於言語的形成過程,而非內容本身。
「合成語音雖流暢,卻缺乏生物與認知層面的細微差異,」張博士指出。該公司模型檢測準確率位居前10%,僅需3至5秒音訊即可判別。
金繼的創新技術為心理健康困境者帶來希望,尤其在難以獲得專業照護的地區。其技術同樣能革新深度偽造檢測與網路安全領域——透過驗證真實性而非識別偽造內容。
以人為本的技術作為未來
傳統網路安全聚焦於惡意用途或攻擊者。然而金繼的突破性進展,卻奠基於人性本質本身。
「我們開闢了全新戰場:人類真實性。大型語言模型無法穩定識別自身產出內容,而基於人工製品的技術又過於脆弱。蒐集涵蓋真實人類變異的大型臨床註解數據集成本高昂、進度緩慢,更超出多數安全公司的專業範疇——這使我們的技術難以被複製。」張解釋道。
這家新創公司的策略也指向更廣泛的轉變:跨產業創新。醫療保健領域的領導者可開創基於人工智慧的語音詐騙偵測技術,正如太空科技創新者可能協助緊急應變系統,或遊戲架構可能影響都市規劃。
至於張女士,她致力於建立透過語音互動確認真實人類存在——最終確認真實意圖——的標準。
「正如HTTPS成為網路信任標準,我們相信『人類存在驗證』將成為語音系統的必要環節。訊號處理正是此框架的起點。」她如是說。
隨著生成式人工智慧的進步,最強大的防護或許來自於理解何謂真正的「人性」。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (1)
0/500

隨著科技巨頭OpenAI於2025年9月推出旗艦級Sora 2影音生成模型,深度偽造影片已席捲社群媒體,使觀眾對潛在危害性的超寫實內容日漸習以為常。
儘管OpenAI強調將負責任地部署Sora 2作為核心目標——承諾提供用戶「管理資訊流內容的工具與選擇權」,並確保用戶對自身肖像擁有完全控制權——但2025年10月的研究顯示,該模型生成誤導性影片的比率高達80%。
從偽造摩爾多瓦選舉官員銷毀選票的假新聞片段,到虛構幼兒遭移民當局拘留的影像,乃至可口可樂發言人宣布公司將不贊助超級盃的偽造畫面,在這個高度互聯的世界中,虛假資訊的危害性已達空前高峰。
超越Sora:語音詐騙的崛起
早在OpenAI工具問世前,深度偽造內容的創作與傳播便已加速。網路安全公司DeepStrike於2025年9月發布的報告指出,此類內容從2023年的50萬起激增至2025年的800萬起,其中多數用於詐騙。
此趨勢未見緩解跡象;美國AI相關詐騙案預計將於2027年達到400億美元規模。
不僅數量激增,隨著Sora 2與Google Veo 3等工具問世,AI生成人臉、聲音及全身表演的逼真度更達前所未見。電腦科學家暨深度偽造專家呂思偉指出,現行模型能生成穩定無失真的面部影像,而聲音複製技術已達「難以辨別」的境界。
現實情況是,深度偽造技術的演進速度遠超檢測手段。科技公司主打的娛樂工具——用於創作奧運體操動作或豐富音頻背景——正被犯罪分子用於針對企業與個體的詐騙。僅2025年上半年,深度偽造詐騙就造成企業損失3.56億美元,個人損失達5.41億美元。
傳統的深度偽造檢測技術——如檢查水印、修圖痕跡及元數據——已顯力不從心。與此同時,語音深度偽造躍居第二大常見AI詐騙手段,2025年語音釣魚攻擊激增442%,影響範圍極廣。
呂博士指出:「如今僅需數秒音頻,便能生成具備自然語調、節奏、重音、情感、停頓甚至呼吸聲的逼真克隆人。」
傾聽人類之聲
健康科技新創公司Kintsugi開發人工智慧語音生物標記技術,用以識別臨床憂鬱與焦慮徵兆。其研究源於一個簡單理念:我們需要真正傾聽人們的心聲。
「創立金繼的契機源於親身經歷。當時我耗費近五個月反覆致電醫療機構,僅為預約首次治療,卻無人回電。我持續嘗試——但當時就想著:若是父親或兄弟遭遇此境,恐怕早已放棄。」執行長張玉琪向Unite.AI透露。
這家加州公司於2019年成立,旨在解決張所稱的「分流瓶頸」。她認為早期被動檢測病情嚴重程度,能幫助人們更快獲得適當治療。透過Kintsugi Voice技術,聲音生物標記可協助識別臨床抑鬱與焦慮症狀。
多項研究支持運用人工智慧驅動的語音分析作為心理健康生物標記。例如2025年5月發表的論文指出,聲學生物標記能偵測心理健康問題與神經差異的早期徵兆,並倡導在臨床環境中運用歌唱分析評估潛在認知衰退。
根據美國精神醫學會數據,語音分析技術在78%至96%的案例中能精準區分抑鬱症患者與非患者。另一項研究採用一分鐘詞彙流暢度測試(受試者需盡可能列舉特定類別詞彙),在偵測抑鬱與焦慮共病症例時,準確率達70%至83%。
為評估心理健康狀態,Kintsugi僅需收集簡短語音樣本。其聲紋生物標記技術能解析音高、語調、聲線及停頓等特徵——這些特徵與憂鬱症、焦慮症、躁鬱症及失智症密切相關。
張博士未曾預料的是,這項技術同時解決了安全領域的關鍵難題:精準辨識聲音是否真正源自人類。
從心理健康到網路安全
2025年末於紐約峰會期間,張女士向一位資安領域的朋友提及,其團隊對合成語音的測試成效不彰。
「我們試圖運用合成數據強化心理健康模型的訓練,但生成的聲音與真人語音差異過大,幾乎每次都能被識破,」她解釋道。
「他突然打斷我說:『葛蕾絲——這是資安領域的未解難題。』當下所有線索瞬間串聯起來。此後與資安、金融及電信企業的討論中,我們發現深度偽造語音攻擊正急速擴散——在即時通話中區分真人與合成聲音至關重要。」這位執行長補充道。
去年四月,聯邦調查局曾警示公眾:有惡意簡訊與語音詐騙活動假冒美國高階官員,鎖定前政府雇員及其聯絡人。美國主要銀行平均每日遭遇5.5次語音詐騙企圖,范德堡大學醫學中心員工更通報遭遇冒充友人、主管及同事的語音釣魚攻擊。
最初,深度偽造技術並非Kintsugi的關注重點。儘管團隊運用Cartesia、Sesame及ElevenLabs等模型為客服人員與工作流程模擬合成語音,但在充斥著Sora等普及工具的市場中,深度偽造詐騙並非優先考量。
然而,確認語音真實性的線索正是定義人類言語的生物標記。無論語言或內容為何,Kintsugi Voice皆透過分析訊號處理與物理發聲延遲,捕捉微妙的時序變化、韻律變化、認知負荷及生理特徵——著重於言語的形成過程,而非內容本身。
「合成語音雖流暢,卻缺乏生物與認知層面的細微差異,」張博士指出。該公司模型檢測準確率位居前10%,僅需3至5秒音訊即可判別。
金繼的創新技術為心理健康困境者帶來希望,尤其在難以獲得專業照護的地區。其技術同樣能革新深度偽造檢測與網路安全領域——透過驗證真實性而非識別偽造內容。
以人為本的技術作為未來
傳統網路安全聚焦於惡意用途或攻擊者。然而金繼的突破性進展,卻奠基於人性本質本身。
「我們開闢了全新戰場:人類真實性。大型語言模型無法穩定識別自身產出內容,而基於人工製品的技術又過於脆弱。蒐集涵蓋真實人類變異的大型臨床註解數據集成本高昂、進度緩慢,更超出多數安全公司的專業範疇——這使我們的技術難以被複製。」張解釋道。
這家新創公司的策略也指向更廣泛的轉變:跨產業創新。醫療保健領域的領導者可開創基於人工智慧的語音詐騙偵測技術,正如太空科技創新者可能協助緊急應變系統,或遊戲架構可能影響都市規劃。
至於張女士,她致力於建立透過語音互動確認真實人類存在——最終確認真實意圖——的標準。
「正如HTTPS成為網路信任標準,我們相信『人類存在驗證』將成為語音系統的必要環節。訊號處理正是此框架的起點。」她如是說。
隨著生成式人工智慧的進步,最強大的防護或許來自於理解何謂真正的「人性」。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






