「顶会论文」共找到 2334 篇相关文章
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
从“会用”到“驾驭”:AI Coding 进入生产环境的真实碰撞
InfoQ《极客有约》X AICon 直播栏目,邀网易游戏林香鑫等探讨 Coding Agent 重构软件工程环节。嘉宾分享了 AI Coding 在生产环境的变化、MCP 等概念作用、代码质量保障、Agent 权限及 AI 原生研发体系建设等观点。
I/O大会开完,谷歌连搜索框都变智能体了
当地时间周二谷歌I/O大会举行,转型智能体时代。谷歌推出Gemini 3.5系列模型,轻量级3.5 Flash已开放,重量级3.5 Pro仍在开发。还发布全新AI智能体Spark,改造谷歌搜索,推出多模态模型Gemini Omni。
好看不等于会交互!阿里发布基于交互的世界模型基准
阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。
谷歌最新发表的Science论文,颠覆了人类对ASI的想象
谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。
构建会思考的测试Agent:从自动化到自主智能的演进
文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统到自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。
震惊!如果AI掌控核按钮,95%的情况它会按下去
伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模型模拟核危机博弈。不同时间框架下模型表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。
首篇以第一性原理剖析OpenClaw自进化AI社会的论文
截止发文,OpenClaw项目已达192k Star,其衍生的AI Agents社会网络moltbook聚集大量智能体。北邮等团队首次从第一性原理研究,提出“自进化不可能三角”理论,还给出缓解策略。
Meta超级智能实验室又发论文,模型混一混,性能直接SOTA
大语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。
DeepMind一篇论文终结十年之争!GPT-5推理靠世界模型
GPT-5上线后推理能力惊人。最新研究揭示通用智能体聪明的原因是长出“世界模型”,终结了学界十年关于AI靠模仿还是思考的争论,实验也验证了世界模型对智能体的必要性。