「任务执行」共找到 2287 篇相关文章
ICLR 2026 Oral | 西湖大学发布Real PDE Bench
复杂物理系统时空演化预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三类任务、九个评估指标和十个基线方法。
大模型首次打破围棋思维「黑盒」,打通科学发现新路径!上海AI Lab发布新一代InternThinker
上海AI Lab发布新一代书生·思客(InternThinker),它是我国首个具围棋专业水平且能展示透明思维链的大模型。其得益于InternBootcamp训练环境,还在多任务混合训练中现‘涌现时刻’,背后有通专融合底层技术突破。
字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!
字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。
AI首次拿下IMO官方满分金牌,背后藏着一套自我纠错机制
在第67届国际数学奥林匹克(IMO 2026)上,小红书的「dots-note-3.0」成为首个获官方满分金牌的AI模型。它解题时自我检查修正,有自主探索能力。之后模型要应对生活中长周期、多变任务的挑战。
蛰伏一年,周衔团队带来首个具身基础模型,烹饪做实验弹琴,效果炸场
Genesis AI公布首个机器人基础模型GENE - 26.5,能完成烹饪、解魔方等复杂任务。该模型是全栈系统,以仿真加速迭代,用自研手套采集数据,还重写控制栈。公司后续计划发布全身机器人。
港大×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」
港大联合复旦、上交大提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
突然,被GLM-4.7的Coding交付能力惊到了
国内大模型圈因智谱启动A股上市而兴奋时,GLM系列再展“卷王”姿态,本月开源旗舰GLM - 4.7。它从代码大模型变为任务交付引擎,实测在多场景表现出色,能理解复杂意图、交付高质量代码。
百度 TURA 三阶段架构:让 AI 检索 “动” 起来
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。
OpenAI 黑科技 Deep Research 诞生记:一个工程师的“不务正业”如何改变 AI 战争格局
OpenAI宣布美国用户可免费使用集成于ChatGPT的AI研究助手Deep Research。OpenAI负责人分享其背后故事,探讨起源、人类专家数据作用等,还提及RFT时机、代理安全性等,并展望其能访问私有数据,适用于具体任务。