「视觉Agentic智能」共找到 5888 篇相关文章
OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案
OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
从开源狂热到应用为王,AI 正在回归常识
AI行业正发生变化,模型行业对“开源还是闭源”态度转向商业共识,旗舰模型开始闭源;应用变得更重要,应用层机会多;智能体重新定义AI价值边界,推动行业从“模型思维”走向“系统思维”。
The Batch:827 | Claude 4 推动代码生成能力再升级
Anthropic 发布 Claude 4 Sonnet 和 Claude 4 Opus 模型,支持“推理模式”,能并行调用工具。还发布 Claude Code 编程智能体及 SDK。两款模型输入输出能力强,功能亮点多,性能表现佳,有多种使用渠道和定价。
TabClaw:让 AI 真正读懂你的表格数据
TabClaw 是面向表格数据的 AI 分析 Agent,能让 AI 真正读懂表格数据。它核心标签是全透明与持续进化,工作流分显式和隐式两层,目标是成为真正理解用户、能一起成长的表格分析伙伴,项目已开源。
具身导航:感知推理是上帝,还是执行控制是命门?| GAIR Live 023期预告
具身导航正从‘几何避障’向‘空间智能’跨越,当前领域经历范式变革。GAIR Live 023期线上圆桌将聚焦其前沿进展与落地问题,邀请两位专家拆解底层逻辑,还给出了核心议题、讨论精华预览及参与方式。
Claude Opus 4.7 发布!留给人类的时间,不多了
Anthropic 发布 Claude Opus 4.7,核心升级是让 AI 跑长且复杂任务,还能自我验证结果。它视觉能力超强,编程能力提升,新增 /ultrareview 功能,API 多了调节档,不过 token 数量或增加,成本可能上浮。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
所有Harness终将长成“龙虾”,但最后活下来的只有几只
在用户需求驱动下,工具从 LLM 向 Agent、Harness 再到 Claw 自然进化,但用户能容纳的 Claw 有限。Sam Bhagwat 拆解进化路径,指出各阶段核心竞争力,开发者应抢占用户心智空间。
Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作
Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。