实验闭环验证」共找到 2171 篇相关文章

算法论文8

ICRA 2025|通用多机器人长时任务规划框架破解任务分配难题,成功率+105%、效率+36%

2025年5月,美两校联合团队在ICRA 2025发布LaMMA - P。它融合大模型与PDDL规划器,解决异构多机器人长时任务分配难题,在新基准数据集上,相比SMART - LLM,任务成功率提高105%,执行效率提升36%。

机器之心
开源动态8

通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API

阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。

量子位
算法论文8

天文预测新SOTA!紫东太初&国家天文台联手攻克恒星耀发难题

紫东太初与中国科学院国家天文台联合开发天文耀发预测大模型FLARE,能精准预测恒星耀发事件。该模型整合恒星物理属性和历史耀发记录,提升预测准确性,相关论文被IJCAI 2025录用。

量子位
新闻资讯8

斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心
推荐文章7

「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解

AI编程圈两极分化,围绕底层Harness是否消失争议不断。前Kimi CLI负责人stdrc提出反常识观点,认为模型越强Harness越厚,复杂度从“能力层”转移到“协作层”,还以Kimi CLI实践及Raft创业为例阐述。

AI科技评论
开源动态8

警报拉满,10k star , QuantDinger,赚钱可能就是这么简单!!!!

量化交易常存在研究、策略、回测和实盘间“失忆”问题。QuantDinger将量化流程形成闭环,是Open - source AI Trading OS,有研究、策略管理等四大核心能力,介绍了使用方法、适用人群。

小华同学ai
新闻资讯7

丛乐创办Acelegen:用基因编辑让活细胞成为可编程计算平台

过去五年AI重塑生物技术。CRISPR基因编辑技术开发者丛乐联合创立Acelegen,集成过往成果,欲把活细胞变成可编程计算平台,其愿景是找到“生命的Scaling Law”,独特性显著但答案待揭晓。

DeepTech深科技
算法论文7

做过十遍还要从头摸索?Agent 的记忆终于开始长成技能

MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。

深度学习自然语言处理
算法论文8

GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?

PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。

深度学习自然语言处理
推荐文章7

一人公司创业,如何找对方法论、选准装备库?

AI让一人做产品更易,全国一人有限责任公司数量增长,相关服务生态成形。时踪由阿泰独立研发,从个人痛点出发做出产品,其95%云服务选阿里云。阿里云为OPC创业者提供阶段化“装备库”。

AI前线