2025 年的人臉識別:連體網路或二元分類?
從安全系統到社交媒體,人臉辨識在各種應用中都扮演著重要的角色。雖然三重損失(triplet loss)是一種廣泛應用於訓練卷繞神經網路(CNN)的方法,但另一種策略則是將此任務設定為二元分類問題。這種方法利用連體網路,提供了一種獨特的方式來學習有效的人臉驗證所需的參數。接下來,我們將探討如何利用一對神經網路來產生嵌入。
重點
連體網路對於人臉驗證非常有效。
人臉識別可以建模為二元分類任務。
學習相似性函數包含 logistic 回歸。
預先計算嵌入可提高部署效率。
流程包括資料收集、模型訓練、評估和部署。
臉部驗證和識別都可以使用二進位分類進行訓練,以取代三重損失。
瞭解人臉辨識與驗證
二元分類的人臉識別

人臉識別不只是識別一個人,還要驗證一個人所聲稱的身份。這就是所謂的人臉驗證。一種實用的方法將驗證視為二進制分類問題。與其在眾多臉孔中進行區分,系統不如直接回答一個問題:"這兩張臉是否屬於同一個人?這種二進制框架簡化了問題,並提高了計算效率。此技術依賴於連體網路,由兩個具有共用權重和架構的相同神經網路組成。每個網路處理一張輸入影像,並比較其輸出,以得出相似度得分。如果分數超過定義的臨界值,則認為這兩張臉是匹配的;否則,它們會被分類為不同的臉。經訓練的網路對於匹配的身分會輸出 1,對於不匹配的身分則輸出 0。這與更複雜的系統形成對比,因為複雜的系統必須區分許多已知的個體。
連體網路架構
此方法以連體網路架構為中心。

此架構將兩個相同的神經網路配對,各自處理兩個輸入影像中的一個。這些網路會計算內嵌,也就是編碼獨特臉部特徵的高維向量。透過比較這些內嵌,系統可以評估臉部相似度。嵌入過程通常包括卷積層、池化層和全連結層,每個層級都會從影像中萃取逐步複雜的特徵。最後的輸出是一個向量 - 通常是 128 維 - 它能捕捉基本的臉部特徵。更大的維度也可用於偵測更精細的細節。最重要的是,Siamese 設定中的兩個網路都共用相同的參數,確保嵌入是透過相同的特徵萃取過程產生,而且可以直接比較。
使用邏輯回歸學習相似度函數
使用邏輯回歸

為了判斷兩張臉是否代表同一個人,必須比較來自連體網路的內嵌。邏輯回歸單元會對這些內嵌應用sigmoid 函數,產生一個反映匹配可能性的概率分數。這個單元的輸入並不是原始的內嵌,而是從這些內嵌衍生出來的特徵。常見的方法是計算兩個嵌入式之間的元素絕對差異,強調差異最大的特徵。Chi-square 相似度是另一種常用的技術。目的是形成高度區別的特徵,讓邏輯迴歸單元能做出精確的預測。元素之間的差異會饋入邏輯迴歸模型,而邏輯迴歸模型會學習分配適當的權重。如果差異極小,該單元會指定高概率,表示是同一個人;如果差異很大,則會指定低概率,表示是不同的個人。
訓練連體網路和 Logistic 回歸
逐步訓練流程
- 收集訓練資料:首先編譯一個人臉影像資料集,標籤顯示影像對描繪的是同一人還是不同的人。此資料集可訓練連體網路和邏輯迴歸單元。
- 設定連體網路:設定兩個具有相同架構和共用權重的相同 CNN。這些網路將學習從輸入的臉部影像產生嵌入。
- 計算特徵差異:確定每個影像對的兩個 CNN 所產生的內嵌之間的元素絕對差異。這些差異會成為邏輯回歸單元的輸入特徵。
- 整合邏輯迴歸:運用邏輯迴歸模型將特徵差異轉換成概率分數,以顯示人臉是否匹配。
- 微調:透過調整分配給特徵的權重 (例如 128 維嵌入中的權重),精細化邏輯迴歸層。
- Backpropagation 訓練:使用反向傳播訓練完整的系統 - 網路與邏輯回歸單元。這可最小化懲罰預測錯誤的損失函數,藉由最佳化網路權重和偏置,逐漸提高準確度。
- 調整權重:最終的邏輯迴歸模型可以包含額外的參數,例如權重 (W) 和偏置 (B)。
- 預先計算嵌入:為了加快部署速度,可以預先計算嵌入,以便進行快速比較。
人臉辨識連體網路的優缺點
優點
運算效率
直接處理人臉驗證
有效的特徵萃取
缺點
訓練資料需求
過度擬合的可能性
泛化程度有限
常見問題
什麼是連體網路,它們在人臉識別中如何運作?
連體網路是由兩個或兩個以上相同子網路組成的神經網路。每個子網路接收不同的輸入,但與其他子網路共享權重。在人臉識別中,這些網路會處理成對的人臉影像以產生嵌入,然後評估其相似性。
為什麼有時人臉識別被視為二元分類問題?
將人臉辨識視為二元分類問題,可將其簡化為判斷兩張人臉是否匹配,相較於區分許多個人,可提高效率。此方法使用連體網路來比較成對的人臉影像。
在學習人臉識別的相似性函數時,邏輯回歸的作用是什麼?
Logistic 回歸將連體網路嵌入之間的差異映射為概率分數。此分數可估算出兩張臉是同一人的可能性,以支援二元判斷。
相關問題
此連體網路方法與傳統方法(如 triplet loss)比較如何?
傳統的方法(如三連丟失)旨在學習一個嵌入空間,在這個空間中,同一個人的面孔會比較接近,而不同人的面孔會比較遠。二元分類結構的暹羅網路則專注於驗證兩張臉是否相同,提供了計算上的優勢。最佳選擇取決於特定的應用程式和資料集特性。
是否有其他方法可以評估嵌入的相似性?
有,其他方法包括余弦相似度、歐氏距離和卡方相似度。卡方相似度公式提供了另一種方法來進行人臉識別。每種技術都有其優點,適用於不同的資料類型和使用個案。例如,余弦相似性在高維數據中表現良好,而歐氏距離在低維數據中則很有效。
實際部署受過訓練的系統需要做什麼?
部署需要預先計算嵌入,以避免儲存原始影像。本系統以連體網路架構為基礎,旨在有效比較這些內嵌值。
相關文章
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
相關專題推薦
評論 (2)
0/500
Interessant, dass hier Siamese Networks und binäre Klassifikation verglichen werden. Ich frage mich, ob die Wahl je nach Anwendungsfall variieren sollte – vielleicht ist der eine Ansatz für Sicherheitssysteme besser, der andere für Social Media? 🤔 Die Diskussion um Triplet Loss vs. Alternativen zeigt, wie dynamisch das Feld noch ist. Hoffentlich bleibt die Ethik dabei nicht auf der Strecke, gerade bei Gesichtserkennung.
從安全系統到社交媒體,人臉辨識在各種應用中都扮演著重要的角色。雖然三重損失(triplet loss)是一種廣泛應用於訓練卷繞神經網路(CNN)的方法,但另一種策略則是將此任務設定為二元分類問題。這種方法利用連體網路,提供了一種獨特的方式來學習有效的人臉驗證所需的參數。接下來,我們將探討如何利用一對神經網路來產生嵌入。
重點
連體網路對於人臉驗證非常有效。
人臉識別可以建模為二元分類任務。
學習相似性函數包含 logistic 回歸。
預先計算嵌入可提高部署效率。
流程包括資料收集、模型訓練、評估和部署。
臉部驗證和識別都可以使用二進位分類進行訓練,以取代三重損失。
瞭解人臉辨識與驗證
二元分類的人臉識別

人臉識別不只是識別一個人,還要驗證一個人所聲稱的身份。這就是所謂的人臉驗證。一種實用的方法將驗證視為二進制分類問題。與其在眾多臉孔中進行區分,系統不如直接回答一個問題:"這兩張臉是否屬於同一個人?這種二進制框架簡化了問題,並提高了計算效率。此技術依賴於連體網路,由兩個具有共用權重和架構的相同神經網路組成。每個網路處理一張輸入影像,並比較其輸出,以得出相似度得分。如果分數超過定義的臨界值,則認為這兩張臉是匹配的;否則,它們會被分類為不同的臉。經訓練的網路對於匹配的身分會輸出 1,對於不匹配的身分則輸出 0。這與更複雜的系統形成對比,因為複雜的系統必須區分許多已知的個體。
連體網路架構
此方法以連體網路架構為中心。

此架構將兩個相同的神經網路配對,各自處理兩個輸入影像中的一個。這些網路會計算內嵌,也就是編碼獨特臉部特徵的高維向量。透過比較這些內嵌,系統可以評估臉部相似度。嵌入過程通常包括卷積層、池化層和全連結層,每個層級都會從影像中萃取逐步複雜的特徵。最後的輸出是一個向量 - 通常是 128 維 - 它能捕捉基本的臉部特徵。更大的維度也可用於偵測更精細的細節。最重要的是,Siamese 設定中的兩個網路都共用相同的參數,確保嵌入是透過相同的特徵萃取過程產生,而且可以直接比較。
使用邏輯回歸學習相似度函數
使用邏輯回歸

為了判斷兩張臉是否代表同一個人,必須比較來自連體網路的內嵌。邏輯回歸單元會對這些內嵌應用sigmoid 函數,產生一個反映匹配可能性的概率分數。這個單元的輸入並不是原始的內嵌,而是從這些內嵌衍生出來的特徵。常見的方法是計算兩個嵌入式之間的元素絕對差異,強調差異最大的特徵。Chi-square 相似度是另一種常用的技術。目的是形成高度區別的特徵,讓邏輯迴歸單元能做出精確的預測。元素之間的差異會饋入邏輯迴歸模型,而邏輯迴歸模型會學習分配適當的權重。如果差異極小,該單元會指定高概率,表示是同一個人;如果差異很大,則會指定低概率,表示是不同的個人。
訓練連體網路和 Logistic 回歸
逐步訓練流程
- 收集訓練資料:首先編譯一個人臉影像資料集,標籤顯示影像對描繪的是同一人還是不同的人。此資料集可訓練連體網路和邏輯迴歸單元。
- 設定連體網路:設定兩個具有相同架構和共用權重的相同 CNN。這些網路將學習從輸入的臉部影像產生嵌入。
- 計算特徵差異:確定每個影像對的兩個 CNN 所產生的內嵌之間的元素絕對差異。這些差異會成為邏輯回歸單元的輸入特徵。
- 整合邏輯迴歸:運用邏輯迴歸模型將特徵差異轉換成概率分數,以顯示人臉是否匹配。
- 微調:透過調整分配給特徵的權重 (例如 128 維嵌入中的權重),精細化邏輯迴歸層。
- Backpropagation 訓練:使用反向傳播訓練完整的系統 - 網路與邏輯回歸單元。這可最小化懲罰預測錯誤的損失函數,藉由最佳化網路權重和偏置,逐漸提高準確度。
- 調整權重:最終的邏輯迴歸模型可以包含額外的參數,例如權重 (W) 和偏置 (B)。
- 預先計算嵌入:為了加快部署速度,可以預先計算嵌入,以便進行快速比較。
人臉辨識連體網路的優缺點
優點
運算效率
直接處理人臉驗證
有效的特徵萃取
缺點
訓練資料需求
過度擬合的可能性
泛化程度有限
常見問題
什麼是連體網路,它們在人臉識別中如何運作?
連體網路是由兩個或兩個以上相同子網路組成的神經網路。每個子網路接收不同的輸入,但與其他子網路共享權重。在人臉識別中,這些網路會處理成對的人臉影像以產生嵌入,然後評估其相似性。
為什麼有時人臉識別被視為二元分類問題?
將人臉辨識視為二元分類問題,可將其簡化為判斷兩張人臉是否匹配,相較於區分許多個人,可提高效率。此方法使用連體網路來比較成對的人臉影像。
在學習人臉識別的相似性函數時,邏輯回歸的作用是什麼?
Logistic 回歸將連體網路嵌入之間的差異映射為概率分數。此分數可估算出兩張臉是同一人的可能性,以支援二元判斷。
相關問題
此連體網路方法與傳統方法(如 triplet loss)比較如何?
傳統的方法(如三連丟失)旨在學習一個嵌入空間,在這個空間中,同一個人的面孔會比較接近,而不同人的面孔會比較遠。二元分類結構的暹羅網路則專注於驗證兩張臉是否相同,提供了計算上的優勢。最佳選擇取決於特定的應用程式和資料集特性。
是否有其他方法可以評估嵌入的相似性?
有,其他方法包括余弦相似度、歐氏距離和卡方相似度。卡方相似度公式提供了另一種方法來進行人臉識別。每種技術都有其優點,適用於不同的資料類型和使用個案。例如,余弦相似性在高維數據中表現良好,而歐氏距離在低維數據中則很有效。
實際部署受過訓練的系統需要做什麼?
部署需要預先計算嵌入,以避免儲存原始影像。本系統以連體網路架構為基礎,旨在有效比較這些內嵌值。
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
Interessant, dass hier Siamese Networks und binäre Klassifikation verglichen werden. Ich frage mich, ob die Wahl je nach Anwendungsfall variieren sollte – vielleicht ist der eine Ansatz für Sicherheitssysteme besser, der andere für Social Media? 🤔 Die Diskussion um Triplet Loss vs. Alternativen zeigt, wie dynamisch das Feld noch ist. Hoffentlich bleibt die Ethik dabei nicht auf der Strecke, gerade bei Gesichtserkennung.





首頁






