微軟將輕量級多模態 AI 模型 Phi-4-Vision 開源
微軟已正式將其最新的多模態推理模型「Phi-4-reasoning-vision-15B」開源。這款擁有 150 億參數的模型,在高效能與低成本之間取得了理想的平衡。其輕量級架構使其成為在資源受限環境中處理複雜視覺任務的絕佳新選擇。
由精煉數據驅動的「精簡強者」
有別於通常需以數兆個標記進行訓練的業界標準模型,Phi-4-reasoning-vision 僅使用 2000 億個多模態標記便成功開發完成。開發團隊透過嚴格清理開源資料、生成針對性的合成資料,以及精確校準領域專屬資料的比例(例如增加數學內容以強化計算推理能力),將資料品質置於首位。此方法使其在科學推理與螢幕元素定位任務中展現出卓越的表現。

創新的混合推理策略
此模型的關鍵創新在於其「混合推理路徑」設計:
感知任務:針對圖像描述或 OCR 等直觀任務,模型預設採用直接回答模式,以速度與低延遲為優化目標。
推理任務:當面對複雜邏輯(例如解讀數學公式或科學圖表)時,模型會自動啟動結構化的「思維鏈」(CoT)流程,以確保答案的準確性。
使用者亦可透過特定觸發語句手動切換這兩種模式,使模型行為適應不同的應用需求。
透過整合 SigLIP-2 動態解析編碼器,該模型在辨識高解析度螢幕截圖中的細微細節方面表現卓越。此能力使其成為開發電腦使用代理程式(CUA)的理想基礎,這些代理程式能精準識別並與數位介面上的按鈕、輸入欄位及其他元素進行互動。
Phi-4-reasoning-vision-15B 現已於各大開源平台上線。微軟預期,這款精簡型模型將在多模態領域中展現「更小、更快」亦能代表「更強大」的可能,進而推動空間智能與即時互動技術的廣泛應用。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (1)
0/500
微軟已正式將其最新的多模態推理模型「Phi-4-reasoning-vision-15B」開源。這款擁有 150 億參數的模型,在高效能與低成本之間取得了理想的平衡。其輕量級架構使其成為在資源受限環境中處理複雜視覺任務的絕佳新選擇。
由精煉數據驅動的「精簡強者」
有別於通常需以數兆個標記進行訓練的業界標準模型,Phi-4-reasoning-vision 僅使用 2000 億個多模態標記便成功開發完成。開發團隊透過嚴格清理開源資料、生成針對性的合成資料,以及精確校準領域專屬資料的比例(例如增加數學內容以強化計算推理能力),將資料品質置於首位。此方法使其在科學推理與螢幕元素定位任務中展現出卓越的表現。

創新的混合推理策略
此模型的關鍵創新在於其「混合推理路徑」設計:
感知任務:針對圖像描述或 OCR 等直觀任務,模型預設採用直接回答模式,以速度與低延遲為優化目標。
推理任務:當面對複雜邏輯(例如解讀數學公式或科學圖表)時,模型會自動啟動結構化的「思維鏈」(CoT)流程,以確保答案的準確性。
使用者亦可透過特定觸發語句手動切換這兩種模式,使模型行為適應不同的應用需求。
透過整合 SigLIP-2 動態解析編碼器,該模型在辨識高解析度螢幕截圖中的細微細節方面表現卓越。此能力使其成為開發電腦使用代理程式(CUA)的理想基礎,這些代理程式能精準識別並與數位介面上的按鈕、輸入欄位及其他元素進行互動。
Phi-4-reasoning-vision-15B 現已於各大開源平台上線。微軟預期,這款精簡型模型將在多模態領域中展現「更小、更快」亦能代表「更強大」的可能,進而推動空間智能與即時互動技術的廣泛應用。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






