「全模态推理」共找到 3724 篇相关文章
谷歌IMO金牌模型可以用了!推理性能秒了o3、Grok 4
谷歌拿下IMO金牌的模型Gemini 2.5 Deep Think已在Gemini App推出,速度更快、实用性更强。该模型仅对Ultra订阅用户开放,月费约1803元。其推理性能超o3、Grok 4,有迭代开发等优势。
从需求到设计到代码,一个软件全搞定!TRAE Work Design实测来了
TRAE Work上新Design模式,与Work、Code模式配合,实现需求、设计、代码全链路在一个平台跑通。它能识别提取设计系统,提供多种改图方式,且出图合规、改图顺手,还简化了工作流。
剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了
剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。
AI科研全周期拆解:从选题到宣发,哪里能放手,哪里得盯着
Awesome AI Auto-Research Team 综述梳理 AI 科研全周期能力与局限,按四阶段八环节拆解,介绍五种方法范式,指出各阶段应用情况、瓶颈及规律,强调人本治理的 AI 辅助科研才是可信路径。
无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%
西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。
我用MiniMax Agent开发了个带后端的全栈网站,全程0代码
2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。
一人作弊,全组「连坐」拒稿! ICML最狠新规,华人大佬挂帅严查
ICML程序主席发布同行评审新举措,包括打击“切香肠”式投稿、“连带直接拒稿”机制、审稿人互惠原则等,若有人论文作弊,全组投稿或被拒,2026年会议将由华人大佬挂帅。
WAIC机器人探展:我被全场最靓的崽「Moz1」种草了
2025 年世界人工智能大会上,千寻智能的人形机器人 Moz1 大放异彩。它搭载自研 VLA 模型 Spirit v1,具备强大泛化能力,硬件也有多项突破。千寻智能全栈自研技术,资本持续加码,有望推动具身智能商业应用。
一个超级搜索Agent开源,超低成本拉满搜索推理能力!小参数、慢思考。
MiroThinker 1.5发布,打响2026年AI模型进步第一枪。它以小参数实现高性能,解决信息雾霾、AI幻觉、决策无力等问题,通过交互式扩展和时序敏感训练沙盒技术,展现强大搜索推理能力。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。