openJiuwen 社区发布了 Skill-Omni,这是业内首个经过工程验证的多模态技能框架。该框架将 AI 智能体从仅支持文本处理的能力提升至具备视觉感知能力,能够通过将网页截图、界面状态及视频序列转换为可重复使用的视觉资源,从而实现照片编辑和 GUI 操作等任务的精准执行。其内置的自动生成工具可从在线内容中创建多模态技能,同时还会采用按需加载机制,仅在必要时才读取相关视觉信息。这一举措标志着智能体体验工程从以文档驱动转向多模态驱动,目前该功能已在 JiuwenSwarm 中正式上线。
评论 (0)
0/300





首页
