「长链推理」共找到 2758 篇相关文章
冲159K星 OpenClaw工具链,正在悄悄改变Agent玩法
Clawdbot更名openclaw后在github星冲到159K。它能让AI深入工作流且保数据隐私,有集成渠道多、工具齐全、有状态会话与持久记忆、路由策略适配不同模型等核心能力,并在多方面优于常见AI工具。
西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速
扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。
AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型
文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。
英伟达Thor芯片屡屡延期:车企被迫转身,供应链迎来机遇
英伟达原计划的Thor芯片因架构和设计缺陷多次跳票,性能大幅缩水至约700TOPS,打乱国产车企规划,小鹏、理想等厂商回调旧方案或加速自研。同时,也为国产芯片企业带来机遇,推动市场走向多元竞争。
零基础指南:从 Prompt 到上下文工程构建 AI Agent 【万字长】
作者结合培训经历,系统梳理零基础构建 AI Agent 的学习路径,涵盖结构化提示词工程、上下文工程与知识检索、工具函数设计和 Agent 规划等内容,还介绍各环节方法、策略和实践案例。
JHU教授揭秘学术潜规则:普通博士如何打破鄙视链翻盘?
约翰霍普金斯助理教授Anand Bhattad用亲身经历,总结给博士生的硬核生存指南,揭秘学术潜规则,如出身门槛、指标焦虑等问题,并给出突围策略和主动方法。
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
Claude两个新模型实测流出!空间推理封神,算力直接榨干了
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
宇树背后的供应链赌局:不怕错,怕空|甲子光年
文章介绍新能安,作为宁德时代和新能源科技合资子公司,在多领域成龙头。它凭借技术积累切入人形机器人电池赛道,给宇树供货,试图建立标准,虽赛道有泡沫和风险,但提前布局或占先机。