「视觉 Agent」共找到 3296 篇相关文章
揭秘!腾讯如何训练多智能体像专家一样设计游戏场景
腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。
Devin CEO:别搞多智能体!Anthropic:我们性能提升90%!
最近,开发Devin的Cognition CEO发文称不要构建多智能体系统,而Anthropic分享构建多智能体研究系统,性能提升90%。Cognition认为多智能体协同难,坚持单线程线性Agent;Anthropic用工程设计绕开瓶颈。二者因任务类型不同观点有别。
全球爆红后,Clawdbot之父2小时深度专访:退休3年后我杀回江湖
新智元对Clawdbot之父Peter Steinberger进行近2小时专访。他分享AI编程工作流,如一天600个Commit、让AI验证代码、用多个Agent并行开发。他还讲述经历,认为AI时代程序员要关注系统架构,强调与AI融合。
通用型产品增长停滞,垂直赛道成市场新解法丨季度AI 100数据解读
新一季度「AI 100」双榜单出炉,量子位智库分析1000+款AI产品。Web端总访问量和MAU增长停滞,头部下滑;APP端中腰部产品表现佳。Agent产品用户增长亮眼,未来桌面端和Web端定位将区分。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
System 3 觉醒:从“工具”到“物种”的根本改变
西湖大学与上海交大新论文提出System 3概念及Sophia框架,将认知心理学概念映射到代码模块,让AI Agent像“生命体”生存。采用前向学习和混合奖励机制,实验显示其能力显著进化,为人工生命指明道路。
官宣!前 OpenAI 华人科学家姚顺雨加入腾讯,大模型“系统战”开启!
12月17日消息,前OpenAI科学家姚顺雨加盟腾讯,任首席AI科学家等职。他是AI Agent与大模型推理领军人物,其加入是腾讯AI补强。腾讯还新成立三部门,标志战略向系统化工程建设进阶,混元也有不错表现。
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
一个销售数据分析机器人的诞生:看 Dify 如何在 DMS 助力下实现自动化闭环
Dify是低代码AI应用开发平台,但在企业级落地有代码执行和自动化调度瓶颈。本文介绍用“Dify + DMS Notebook + DMS Airflow”架构,以销售数据分析机器人为例,展示构建可调度、可扩展、可运维Agent系统的方法。
PixelRefer :让AI从“看大图”走向“看懂每个对象”
多模态大模型多停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在多项任务表现领先,轻量版性能优,还开源两类数据集。