Openai推出了企業的AI代理開發工具

在週二,OpenAI 推出了一系列新工具,旨在協助開發者和企業利用 OpenAI 的專有 AI 模型和框架打造 AI 代理—能夠自主執行任務的系統。
這些工具是 OpenAI 新推出的 Responses API 的一部分,該 API 使企業能夠創建自訂的 AI 代理,這些代理能夠進行網路搜尋、篩選公司檔案以及瀏覽網站,類似於 OpenAI 的 Operator 產品。Responses API 將取代公司的 Assistants API,OpenAI 計劃在 2026 年上半年逐步淘汰 Assistants API。
近年來,AI 代理的熱潮迅速增長,儘管科技產業在明確定義和展示“AI 代理”實際含義方面面臨挑戰。最近的一個例子是中國初創公司 Butterfly Effect,其 Manus AI 代理平台因病毒式傳播而受到關注,但用戶發現其表現遠低於公司的大膽宣稱。
OpenAI 面臨著兌現 AI 代理承諾的壓力。
「展示你的代理很容易,」OpenAI 的 API 產品負責人 Olivier Godement 在接受 TechCrunch 採訪時表示。「要擴展代理非常困難,讓人們經常使用它則更加困難。」
今年早些時候,OpenAI 在 ChatGPT 中推出了兩個 AI 代理:Operator,可代表你瀏覽網站;以及 deep research,可編纂研究報告。雖然這些工具展示了代理技術的潛力,但在自主性方面仍有許多不足。
透過 Responses API,OpenAI 旨在提供驅動 AI 代理的核心組件,使開發者能夠創建屬於自己的 Operator 和 deep research 風格的應用程式。目標是讓開發者打造出比現有應用更具自主性的應用程式。
開發者可以利用 Responses API 使用驅動 OpenAI 的 ChatGPT Search 網路搜尋工具的相同 AI 模型:GPT-4o search 和 GPT-4o mini search。這些模型可以搜尋網路以回答問題,並在生成回應時引用來源。
OpenAI 聲稱 GPT-4o search 和 GPT-4o mini search 都具有高準確性。在公司的 SimpleQA 基準測試中,該測試評估模型回答簡短、基於事實問題的能力,GPT-4o search 獲得 90% 的分數,而 GPT-4o mini search 達到 88%。相比之下,體型更大的 GPT-4.5 模型僅得 63%。
Responses API 還包括一個檔案搜尋工具,可以快速掃描公司資料庫以檢索資訊。OpenAI 保證不會使用這些檔案來訓練其模型。此外,開發者可以存取 OpenAI 的 Computer-Using Agent(CUA)模型,該模型驅動 Operator,使其能透過生成滑鼠和鍵盤動作來自動化資料輸入和應用程式工作流程等任務。
根據 OpenAI 的說法,企業可以選擇在自己的系統上運行目前處於研究預覽階段的 CUA 模型。Operator 中可用的消費者版本 CUA 僅限於基於網路的動作。
需要注意的是,Responses API 無法解決當前 AI 代理面臨的所有技術挑戰。
雖然 AI 驅動的搜尋工具比傳統 AI 模型更準確—這並不意外,因為它們能夠直接查詢答案—但網路搜尋並未消除 AI 幻覺問題。GPT-4o search 仍有 10% 的實事問題回答錯誤。此外,AI 搜尋工具在處理如「湖人今天比分」這類簡短的導航查詢時常遇到困難,近期報告也質疑 ChatGPT 引用的可靠性。
在與 TechCrunch 分享的部落格文章中,OpenAI 承認 CUA 模型「尚未在操作系統上自動化任務時高度可靠」,且可能會犯「無意」的錯誤。
然而,OpenAI 強調這些是其代理工具的早期版本,公司正在持續改進。
除了 Responses API,OpenAI 還發布了一個開源工具包,稱為 Agents SDK,為開發者提供免費工具,以便將模型與內部系統整合、實施安全措施,並監控 AI 代理活動以進行除錯和優化。Agents SDK 是 OpenAI 去年末發布的 Swarm 框架(用於多代理協調)的進化版本。
Godement 表示希望 OpenAI 能在今年縮小 AI 代理展示與實際產品之間的差距,他認為「代理是 AI 最具影響力的應用」。這與 OpenAI 執行長 Sam Altman 在一月發表的聲明相符,他預測 2025 年將是 AI 代理加入勞動力的年份。
無論 2025 年是否真正成為「AI 代理之年」,OpenAI 的最新發布顯示公司正從展示令人印象深刻的代理演示轉向開發具有現實影響力的工具。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (27)
0/500
와, 진짜 AI 에이전트 개발 툴이 나왔네. 하지만 자율적인 작업 수행 기능에 대해 약간의 우려도 들고... 비즈니스에 적용하기엔 아직 너무 이른 건 아닐까? OpenAI가 계속 선두를 달리는 게 인상적이긴 해요. 😅
Finalmente ferramentas práticas para criar agentes de IA! A autonomia desses sistemas me faz pensar: será que em breve teremos assistentes que realmente entendem contexto como humanos? 🤔 Ainda estou cético sobre como lidarão com tarefas complexas do mundo real.
Als Entwickler frage ich mich, ob diese Tools wirklich so einfach zu integrieren sind, wie OpenAI behauptet. Die Versprechen klingen gut, aber ich habe Bedenken bezüglich der Daten- und Funktionssicherheit! 😅 Werden uns am Ende die Agenten irgendwann ersetzen?
Super cool that OpenAI's dropping these AI agent tools! Can't wait to see what businesses build with this—maybe smarter chatbots or auto-scheduling systems? 🚀
Super cool that OpenAI is dropping these AI agent tools! Makes me wonder how small businesses will use them to compete with the big dogs. 🐶

在週二,OpenAI 推出了一系列新工具,旨在協助開發者和企業利用 OpenAI 的專有 AI 模型和框架打造 AI 代理—能夠自主執行任務的系統。
這些工具是 OpenAI 新推出的 Responses API 的一部分,該 API 使企業能夠創建自訂的 AI 代理,這些代理能夠進行網路搜尋、篩選公司檔案以及瀏覽網站,類似於 OpenAI 的 Operator 產品。Responses API 將取代公司的 Assistants API,OpenAI 計劃在 2026 年上半年逐步淘汰 Assistants API。
近年來,AI 代理的熱潮迅速增長,儘管科技產業在明確定義和展示“AI 代理”實際含義方面面臨挑戰。最近的一個例子是中國初創公司 Butterfly Effect,其 Manus AI 代理平台因病毒式傳播而受到關注,但用戶發現其表現遠低於公司的大膽宣稱。
OpenAI 面臨著兌現 AI 代理承諾的壓力。
「展示你的代理很容易,」OpenAI 的 API 產品負責人 Olivier Godement 在接受 TechCrunch 採訪時表示。「要擴展代理非常困難,讓人們經常使用它則更加困難。」
今年早些時候,OpenAI 在 ChatGPT 中推出了兩個 AI 代理:Operator,可代表你瀏覽網站;以及 deep research,可編纂研究報告。雖然這些工具展示了代理技術的潛力,但在自主性方面仍有許多不足。
透過 Responses API,OpenAI 旨在提供驅動 AI 代理的核心組件,使開發者能夠創建屬於自己的 Operator 和 deep research 風格的應用程式。目標是讓開發者打造出比現有應用更具自主性的應用程式。
開發者可以利用 Responses API 使用驅動 OpenAI 的 ChatGPT Search 網路搜尋工具的相同 AI 模型:GPT-4o search 和 GPT-4o mini search。這些模型可以搜尋網路以回答問題,並在生成回應時引用來源。
OpenAI 聲稱 GPT-4o search 和 GPT-4o mini search 都具有高準確性。在公司的 SimpleQA 基準測試中,該測試評估模型回答簡短、基於事實問題的能力,GPT-4o search 獲得 90% 的分數,而 GPT-4o mini search 達到 88%。相比之下,體型更大的 GPT-4.5 模型僅得 63%。
Responses API 還包括一個檔案搜尋工具,可以快速掃描公司資料庫以檢索資訊。OpenAI 保證不會使用這些檔案來訓練其模型。此外,開發者可以存取 OpenAI 的 Computer-Using Agent(CUA)模型,該模型驅動 Operator,使其能透過生成滑鼠和鍵盤動作來自動化資料輸入和應用程式工作流程等任務。
根據 OpenAI 的說法,企業可以選擇在自己的系統上運行目前處於研究預覽階段的 CUA 模型。Operator 中可用的消費者版本 CUA 僅限於基於網路的動作。
需要注意的是,Responses API 無法解決當前 AI 代理面臨的所有技術挑戰。
雖然 AI 驅動的搜尋工具比傳統 AI 模型更準確—這並不意外,因為它們能夠直接查詢答案—但網路搜尋並未消除 AI 幻覺問題。GPT-4o search 仍有 10% 的實事問題回答錯誤。此外,AI 搜尋工具在處理如「湖人今天比分」這類簡短的導航查詢時常遇到困難,近期報告也質疑 ChatGPT 引用的可靠性。
在與 TechCrunch 分享的部落格文章中,OpenAI 承認 CUA 模型「尚未在操作系統上自動化任務時高度可靠」,且可能會犯「無意」的錯誤。
然而,OpenAI 強調這些是其代理工具的早期版本,公司正在持續改進。
除了 Responses API,OpenAI 還發布了一個開源工具包,稱為 Agents SDK,為開發者提供免費工具,以便將模型與內部系統整合、實施安全措施,並監控 AI 代理活動以進行除錯和優化。Agents SDK 是 OpenAI 去年末發布的 Swarm 框架(用於多代理協調)的進化版本。
Godement 表示希望 OpenAI 能在今年縮小 AI 代理展示與實際產品之間的差距,他認為「代理是 AI 最具影響力的應用」。這與 OpenAI 執行長 Sam Altman 在一月發表的聲明相符,他預測 2025 年將是 AI 代理加入勞動力的年份。
無論 2025 年是否真正成為「AI 代理之年」,OpenAI 的最新發布顯示公司正從展示令人印象深刻的代理演示轉向開發具有現實影響力的工具。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
와, 진짜 AI 에이전트 개발 툴이 나왔네. 하지만 자율적인 작업 수행 기능에 대해 약간의 우려도 들고... 비즈니스에 적용하기엔 아직 너무 이른 건 아닐까? OpenAI가 계속 선두를 달리는 게 인상적이긴 해요. 😅
Finalmente ferramentas práticas para criar agentes de IA! A autonomia desses sistemas me faz pensar: será que em breve teremos assistentes que realmente entendem contexto como humanos? 🤔 Ainda estou cético sobre como lidarão com tarefas complexas do mundo real.
Als Entwickler frage ich mich, ob diese Tools wirklich so einfach zu integrieren sind, wie OpenAI behauptet. Die Versprechen klingen gut, aber ich habe Bedenken bezüglich der Daten- und Funktionssicherheit! 😅 Werden uns am Ende die Agenten irgendwann ersetzen?
Super cool that OpenAI's dropping these AI agent tools! Can't wait to see what businesses build with this—maybe smarter chatbots or auto-scheduling systems? 🚀
Super cool that OpenAI is dropping these AI agent tools! Makes me wonder how small businesses will use them to compete with the big dogs. 🐶





首頁






