视觉任务」共找到 2423 篇相关文章

算法论文8

1/15成本,实现AI水印新SOTA | 南洋理工大学&A*STAR

给AI生成作品打水印成行业共识,但传统方法有短板。南洋理工大学等机构研究人员提出局部鲁棒图像水印方法MaskMark,成本仅为Meta模型WAM的1/15,在多任务中表现优异。

量子位
开源动态8

斩获22K star!再见重复劳动,微软AI开源智能办公机器人来了!抓紧用起来

微软推出视觉自动化神器`OmniParser`,上线GitHub获22K star。它重新定义人机协作,有三大能力、五大自动化杀手锏,适用于六大实战场景,还给出速成指南,与同类方案相比优势明显,正重塑办公范式。

小华同学ai
算法论文8

在「想象」中练就真机能力:RISE,让VLA强化学习告别真机试错

香港大学李弘扬老师团队提出 RISE 框架,通过组合式世界模型让机器人在虚拟空间强化学习,解决传统 VLA 模型落地难题,在长程任务中性能提升显著,重新定义智能体理解世界的方式。

机器之心
开源动态7

登顶AndroidWorld开源榜首!可以操作手机的移动端AI Agent。

Minitap开源的手机Agent登顶AndroidWorld开源榜首,亮点是能操控安卓与iOS模拟器。用户用自然语言就能完成复杂任务,还具备跨平台控制、全场景交互等特点,项目可快速部署。

开源AI项目落地
新闻资讯8

Andrej Karpathy 分享ChatGPT模型选择指南

前OpenAI创始成员Andrej Karpathy发文分享ChatGPT模型使用指南,点出关键事实,如o3适合重要任务。社区热烈讨论,专业用户分享策略,还对o4 - mini等模型表现给出反馈。

AGI Hunt
新闻资讯7

让Agent真正“行动”起来,Agent Skill开发者大赛火热报名中!

人工智能下半场关键词是“行动”,Agent Skill成关键桥梁。Agent Skill开发者大赛今日启动,由AIGC开放社区与算泥社区联合主办,聚焦真实任务执行,设双赛道,官方提供支持,有丰厚奖励。

AIGC开放社区
新闻资讯7

陶哲轩亲测Claude跑崩电脑,全靠这份保姆级指令清单翻盘

全球顶尖数学家陶哲轩实测Claude Code,首次完全放权致电脑崩溃。后拆分任务、给出「保姆级」指令,约半小时完成证明。他强调人类应保持「人类在环」,拒绝过度依赖AI。

新智元
新闻资讯8

OpenAI深夜发布ChatGPT Agent:能主动思考、自选工具,智能体赛道大变天

今天凌晨1点,OpenAI发布ChatGPT Agent,它能自主思考行动,自选工具完成复杂任务。首席执行官Sam Altman发文介绍,虽实用但有风险,内置安全机制。测试中表现优异,网友期待体验。

AIGC开放社区
推荐文章8

最权威的Skills编写指南来了!33页,Anthropic亲自发布

Anthropic发布33页《Skills编写完整指南》。Skills能为智能体注入行业经验与工作流,实现复杂任务自动化。指南梳理了编写逻辑,涵盖定制、构思、测试、发布等全生命周期内容。

AIGC开放社区
新闻资讯7

GPT-5.4意外泄露!OpenAI最新模型瞄准这2大能力突围

GPT - 5.4疑似泄露,此前在OpenAI编码助手、GitHub代码拉取请求等多处有踪迹。传闻其将搭载200万Tokens上下文窗口,具备像素级精准视觉分析能力,不过也可能是炒作,网友关注其准确率。

量子位