「测试时间扩展」共找到 2429 篇相关文章
如何改变AI研究范式?谷歌DeepResearch新方法TTD-DR原理与实现 | 原理篇
谷歌提出新的DeepResearch方法TTD - DR,它模拟人类研究范式,将Agent起草的初稿视为‘含噪声输出’,经多轮检索 - 改进使初稿成高质量终稿,还引入自进化机制,测试显示其在复杂任务上领先。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
GPT-5实锤,悄悄上线代号「龙虾」!版本号曝光,实测编程惊人能改屎山代码
代号「龙虾」的神秘模型在WebDev Arena现身,网友猜测是GPT - 5,提前试用者称其编程能力惊人,能改屎山代码。多位用户表示其在代码生成等方面超越Claude,OpenAI或已秘密测试。
MeanFlow再下一城,北大提出机器人学习新范式MP1,实现速度与成功率双SOTA
北大研究团队提出机器人学习新范式MP1,将MeanFlow引入机器人学习,实现毫秒级推理速度。还引入分散损失提升少样本泛化能力,在仿真和真机测试中,实现速度与成功率双SOTA。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
曾让 Adobe 豪掷千亿,如今要独立上市了!招股书疯狂点名 AI 150 次,新产品对标 Lovable
网页设计工具开发商 Figma 申请 IPO,招股书提“AI”超 150 次,既视其为“创意加速器”,也认为是“潜在威胁”。该公司业务增长强劲,今年扩展工具库,虽 AI 投入短期内有负面影响,但仍会加倍投入。
ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真
西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
智元下架了首席科学家罗剑岚
量子位发现智元机器人官网合伙人团队名单中,原首席科学家罗剑岚名字不见。此前社媒已有其离职传闻,其个人主页也不再提及智元。此次人事变动时间点微妙,智元刚启动赴港上市流程,具体待官方确认。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。