人类的新AI模型运行像人类这样的计算机,包括错误

你是否梦想过一种能像人类一样无缝与电脑交互的AI?现在,这个梦想已成为现实,这要归功于Anthropic的最新创新。周二,他们推出了新一代Claude AI模型,名为Claude 3.5 Sonnet,它能以惊人的精细度操作电脑。目前处于测试阶段,此AI可供开发者通过API进行试验。
Anthropic自豪地将Claude 3.5 Sonnet称为“首个人公开测试中提供电脑使用功能的前沿AI模型”。这意味着开发者可编程让其在电脑上执行多种任务,如查看屏幕、移动光标、点击按钮,甚至在虚拟键盘上打字。目标是?复制我们每天与电脑的交互方式。
虽然这款新AI仍处于实验阶段,但并非没有瑕疵。它有时会显得有些笨拙和容易出错。但这正是Anthropic发布测试版的原因——从开发者那里收集宝贵反馈,并随时间完善模型。
为什么我们应该关心AI使用电脑?
Anthropic对此有明确答案:“现代工作的绝大部分通过电脑完成。”通过让AI以人类的方式与软件交互,它们开启了当前AI助手无法处理的大量新应用。
开发者和用户如何受益?
Anthropic没有为每个任务创建特定工具,而是教授Claude通用的电脑技能。这使AI能利用为人类设计的各种标准软件程序。开发者可利用此能力自动化重复任务、构建和测试软件,甚至进行研究。
多家公司已在利用Claude 3.5 Sonnet的电脑技能,包括Asana、Canva、Cognition、DoorDash、Replit和The Browser Company。例如,Replit正利用这些能力增强其Replit Agent产品。
他们如何训练Claude使用电脑?
据Anthropic称,训练Claude导航电脑涉及大量试错。过程要求AI理解并解释电脑屏幕的图像,然后根据所见决定采取哪些行动。Claude 3.5 Sonnet通过分析屏幕截图、计算像素以精确移动光标并发出鼠标命令来实现这一点。
Claude的表现如何?
在OSWorld基准测试中,评估AI模型使用电脑的能力,Claude 3.5 Sonnet得分14.9%。虽然这远低于人类70%-75%的表现,但几乎是同类别次佳AI模型7.7%的两倍。
尽管这些结果令人振奋,Claude的电脑使用仍处于初级阶段。它尚无法执行更复杂的任务,如拖动窗口或缩放屏幕。此外,由于依赖屏幕截图,它可能错过某些动作和通知。
Anthropic保持乐观,表示:“我们预计电脑使用功能将迅速改进,变得更快、更可靠、对用户想完成的任务更有用。”他们还强调,随着技术发展,它将对软件开发经验较少的人更易用,同时保持严格的安全措施。
Claude 3.5 Sonnet现已对所有人开放。开发者可在Anthropic API、Amazon Bedrock和Google Cloud的Vertex AI上开始构建电脑使用测试版的应用。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (9)
0/500
Claude 3.5 Sonnet が人間のようにエラーを起こしながらPCを操作するって、なんか怖くない?完璧なAIより、失敗する方が信頼できる気もするけど、セキュリティ面が心配だわ。😅 #Anthropic
Когда ИИ начинает делать те же ошибки, что и я в работе с компьютером, это по-своему успокаивает 😂 Меня беспокоит, насколько мы готовы доверить программному обеспечению такое прямое взаимодействие с интерфейсом. Это ведь прямая дорога как к невероятной производительности, так и к полному хаосу, если что-то пойдет не так. Кажется, пора задуматься о новых 'правилах дорожного движения' для роботов-помощников.
Этот AI, который делает ошибки, как человек, звучит одновременно и забавно, и немного тревожно 😅 Получается, мы создали идеального цифрового стажёра, который тоже путает Ctrl+C и Ctrl+V? Интересно, как это повлияет на безопасность — вдруг он случайно удалит что-то важное, пытаясь 'помочь'?
Wow, Claude 3.5 Sonnet sounds like a game-changer! An AI that mimics human computer use, errors and all? That’s wild. I wonder how it handles my messy desktop and random browser tabs 😅. Super curious to see it in action!

你是否梦想过一种能像人类一样无缝与电脑交互的AI?现在,这个梦想已成为现实,这要归功于Anthropic的最新创新。周二,他们推出了新一代Claude AI模型,名为Claude 3.5 Sonnet,它能以惊人的精细度操作电脑。目前处于测试阶段,此AI可供开发者通过API进行试验。
Anthropic自豪地将Claude 3.5 Sonnet称为“首个人公开测试中提供电脑使用功能的前沿AI模型”。这意味着开发者可编程让其在电脑上执行多种任务,如查看屏幕、移动光标、点击按钮,甚至在虚拟键盘上打字。目标是?复制我们每天与电脑的交互方式。
虽然这款新AI仍处于实验阶段,但并非没有瑕疵。它有时会显得有些笨拙和容易出错。但这正是Anthropic发布测试版的原因——从开发者那里收集宝贵反馈,并随时间完善模型。
为什么我们应该关心AI使用电脑?
Anthropic对此有明确答案:“现代工作的绝大部分通过电脑完成。”通过让AI以人类的方式与软件交互,它们开启了当前AI助手无法处理的大量新应用。
开发者和用户如何受益?
Anthropic没有为每个任务创建特定工具,而是教授Claude通用的电脑技能。这使AI能利用为人类设计的各种标准软件程序。开发者可利用此能力自动化重复任务、构建和测试软件,甚至进行研究。
多家公司已在利用Claude 3.5 Sonnet的电脑技能,包括Asana、Canva、Cognition、DoorDash、Replit和The Browser Company。例如,Replit正利用这些能力增强其Replit Agent产品。
他们如何训练Claude使用电脑?
据Anthropic称,训练Claude导航电脑涉及大量试错。过程要求AI理解并解释电脑屏幕的图像,然后根据所见决定采取哪些行动。Claude 3.5 Sonnet通过分析屏幕截图、计算像素以精确移动光标并发出鼠标命令来实现这一点。
Claude的表现如何?
在OSWorld基准测试中,评估AI模型使用电脑的能力,Claude 3.5 Sonnet得分14.9%。虽然这远低于人类70%-75%的表现,但几乎是同类别次佳AI模型7.7%的两倍。
尽管这些结果令人振奋,Claude的电脑使用仍处于初级阶段。它尚无法执行更复杂的任务,如拖动窗口或缩放屏幕。此外,由于依赖屏幕截图,它可能错过某些动作和通知。
Anthropic保持乐观,表示:“我们预计电脑使用功能将迅速改进,变得更快、更可靠、对用户想完成的任务更有用。”他们还强调,随着技术发展,它将对软件开发经验较少的人更易用,同时保持严格的安全措施。
Claude 3.5 Sonnet现已对所有人开放。开发者可在Anthropic API、Amazon Bedrock和Google Cloud的Vertex AI上开始构建电脑使用测试版的应用。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
Claude 3.5 Sonnet が人間のようにエラーを起こしながらPCを操作するって、なんか怖くない?完璧なAIより、失敗する方が信頼できる気もするけど、セキュリティ面が心配だわ。😅 #Anthropic
Когда ИИ начинает делать те же ошибки, что и я в работе с компьютером, это по-своему успокаивает 😂 Меня беспокоит, насколько мы готовы доверить программному обеспечению такое прямое взаимодействие с интерфейсом. Это ведь прямая дорога как к невероятной производительности, так и к полному хаосу, если что-то пойдет не так. Кажется, пора задуматься о новых 'правилах дорожного движения' для роботов-помощников.
Этот AI, который делает ошибки, как человек, звучит одновременно и забавно, и немного тревожно 😅 Получается, мы создали идеального цифрового стажёра, который тоже путает Ctrl+C и Ctrl+V? Интересно, как это повлияет на безопасность — вдруг он случайно удалит что-то важное, пытаясь 'помочь'?
Wow, Claude 3.5 Sonnet sounds like a game-changer! An AI that mimics human computer use, errors and all? That’s wild. I wonder how it handles my messy desktop and random browser tabs 😅. Super curious to see it in action!





首页






