「推理与计算」共找到 7999 篇相关文章
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法
康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。
超94%类别第一!3D点云异常检测与修复新SOTA | ICCV'25
3D点云异常检测在制造等领域重要,但传统方法有丢细节、难修复问题。上海科大与密歇根大学团队提出PASDF框架,借助相关技术达成检测修复一体化,实验显示精准稳定,在两大基准上成绩优异。
长文本生成迎来新突破:拓元智慧推出 DrDiff ,实现效率与质量双提升
拓元智慧联合多团队开发出 DrDiff 框架,解决长文本生成中效率与质量难兼顾问题。其核心是“动态化”,有分层稀疏注意力、动态专家调度、语义锚点状态三个创新组件,经测试表现良好,未来应用值得期待。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型
Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。
黄仁勋发布量子计算专用CUDA!预言量子计算机几年内应用,但现在还离不开GB200
在GTC巴黎演讲中,英伟达CEO黄仁勋预言量子计算机几年内可实际应用,还推出量子-经典加速超算平台CUDA - Q。此外,他提及物理AI是战略核心,有巨大市场机会,还展示多款产品与技术。
理解了巴菲特“补票”谷歌,就理解了字节、阿里与腾讯的AI入口大战
2026年初,字节、阿里、腾讯围绕AI入口与生态展开争夺。从巴菲特卖苹果买谷歌案例可理解这场大战,谷歌建成AI全栈生态,其他科技巨头布局时各有挑战,AI时代建立生态才能不败。
从 “管好数据” 到 “让数据生智”,华为再发新作《数据空间探索与实践》| 文末赠书
2025年11月15日,机械工业出版社牵头举办研讨会,庆祝《华为数据之道》发行五周年及《数据空间探索与实践》上市。行业大咖齐聚,共话数据治理演进,两书为行业提供了有价值的参考。