多轮序列决策」共找到 463 篇相关文章

推荐文章7

AI 编码效率 x10,Bug 风险也 x10

亚马逊工程师 Joe Mag 分享团队用 Coding Agent 使代码产出效率提 10 倍,但 Bug 风险也放大 10 倍。介绍‘Agentic Coding’工作流,还给出借助 AI 做‘风洞测试’、升级 CI/CD、升级决策和沟通系统等建议。

宝玉AI
新闻资讯8

AI当员工,24小时不休息,17天干完人类数年活!

劳伦斯伯克利国家实验室正将人工智能、自动化技术和数据系统融入科研,构建“人机共生”科研生态。像A - Lab、Autobot等工具发挥重要作用,AI还让大科学装置更智能,实现实时决策,开创“AI设计,实验验证”模式。

AIGC开放社区
算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。

深度学习自然语言处理
算法论文7

大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案

谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。

量子位
算法论文7

Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限

线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。

机器之心
开源动态8

告别抽卡、散装工具拼凑!通用AI视频智能体框架UniVA开源

在AI视频创作中,创作者常因频繁切换工具而疲惫。近期多所高校联合开源的UniVA框架,像「AI导演」,能整合视频工具,提供一站式自动化体验,改变「抽卡」式创作,还支持多轮交互等功能。

新智元
新闻资讯7

华为看好的具身公司又融 10 亿!极佳视界宣布完成 Pre-B 轮融资,老股东超额加持

近日,极佳视界宣布完成近 10 亿元 Pre - B 轮融资,资方阵容豪华,老股东超额加持。此前 2025 年已完成多轮融资,华为还与其深度合作。该公司专注具身基模和通用机器人,产品有世界模型平台等。

AI前线
算法论文8

首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。

新智元
新闻资讯7

Ilya最新证词:谋划一年、52页黑材料、阅后即焚邮件,以及与宿敌Anthropic的合并

Ilya在马斯克起诉Sam Altman案中的62页证词曝光,围绕罢免Altman事件展开。涉及Ilya写的52页秘密备忘录、对Altman的指控、董事会决策情况,还有与Anthropic的合并谈判及Ilya财务利益审查。

AI寒武纪
算法论文8

让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位