「全局因果任务图」共找到 2057 篇相关文章
2026年了,我们还在用爱迪生试灯丝的方式评估World Model
文章围绕World model展开深度讨论,界定其概念,分析生成派、JEPA派、空间智能派三条技术路线,指出评估比LLM难,提及游戏化benchmark可能是破局点,还强调具身进展由数据驱动,Ego - View或为泛化关键。
Auto Research时代,AI Scientist的第一场药企实习考验|甲子光年
AI Scientist从大模型做题家进化为自动化科研助手,但从demo到应用面临买单难题。Phylo等团队构建BiomniBench评估框架,让AI做药企真实数据分析,结果显示AI表现超人类实习生,且有速度和成本优势,但也存在偏科问题。
对话 Lucius 赵赫:AI 员工的本质,是一份有 SLA 的劳动合同
这是对Lucius创始人赵赫的访谈。他表示Lucius做的是企业的Context Layer,提供有SLA的AI员工服务。目前服务三十余家企业,交付结果而非提效,还探讨了AI员工角色、与人类关系、技术架构等内容。
模型都一样了,AI Agent 真正的差距在 Harness 层!
如今各平台接入模型趋同,AI Agent 差距体现在 Harness 层。以天工超级智能体为例,其有约束先行、任务并行编排等亮点,还提供 Skill 粒度新思路,且云端运行降低使用门槛。
从「自我进化」到「DAA」,百度给出 Agent 时代系统答案
2026 年 AI 行业发展微妙,模型能力增强但转化为生产力的企业不多。Create 2026 上百度给出两层答案,构建系统能力,提出 DAA 度量 AI。这是过去三年判断的收束,将非共识整合成面向 Agent 时代的方法论。
CVPR 2026 Highlight|让家电「在仿真中运转起来」,北大正式发布RealAppliance!
北京大学团队提出 RealAppliance 数据集与 RealAppliance - Bench 评测基准。前者收录 100 个精细家电资产,与真实产品系统多层面对齐;后者围绕五项任务评估模型家电操作规划能力,实验显示主流模型仍面临挑战。
把 RAG 做成主流的公司,现在开始“做空”RAG 了
向量数据库开创者 Pinecone 宣布 RAG 时代结束,推出面向 Agent 的知识引擎 Nexus。它认为当前 RAG 模式脆弱、缓慢且昂贵,提出“知识编译”概念,称能提升任务完成率、降低 token 开销,虽面临质疑,但方向明显。
Codex 的野心,MCP 和 Skill 的下一步
作者密集使用Codex App等Agent应用,发现顶尖Agent收敛到相同界面布局。Codex野心大,要处理多格式文件、支持专业工作流。MCP和Skill未解决用户二次编辑问题,插件机制或是出路,Codex已有原始插件市场。
Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 最新对话:Claude 为什么一直限速?
在 5 月 6 日 Anthropic 开发者大会上,兄妹 Dario Amodei 和 Daniela Amodei 对话,谈到 Claude 限速因 2026 年 Q1 增速年化 80 倍远超规划,还涉及开发者生态、模型训练、能力释放等话题,强调平衡发展与安全。
刚刚,国产AI双冠王!黑马世界模型打破全球纪录,一镜到底封神
生数科技的MotuBrain零宣发登顶双榜,打通「看懂世界+执行行动」,适配多个头部机器人本体。它基于Motus进化,具备多本体、多任务、长程执行能力,展示出强大的「一脑多能」和「一脑多型」特点。