日日新6.5」共找到 5413 篇相关文章

算法论文8

首次解释LLM如何推理反思!西北大学谷歌框架:引入贝叶斯自适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索策略,还给出决策数学形式,实验显示其性能更优。

量子位
新闻资讯8

落地商用开启国产一体化智算时代,蓝芯算力LX500亮相滴水湖RISC-V产业论坛

2026年8月13日,第五届滴水湖中国RISC - V产业论坛召开。蓝芯算力生态营销负责人许庆伟以核心产品LX500为线索,从架构、算力、商业落地三方面,展示国产RISC - V算力商用路径。

芯师爷
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL机制

中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
7

AI写论文,AI评阅!AI顶会ICLR完成「AI闭环」,1/5审稿意见纯AI给出

在号称「史上最严管控AI」的顶级会议ICLR 2026上,超五分之一审稿意见由大模型一键生成。这发生在ICLR颁布史上最严LLM规定后不久,引发诸多争议,也凸显AI改写科学评审分工的趋势。

新智元
产品应用7

Qwen深度研究一夜升级!可生成网页和音频播客,模型能认医生手写体

Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更模型,Qwen3 VL能识别医生手写体。实测功能表现出色,Qwen3-VL系列更后性能优异。

量子位
产品应用8

美团龙猫LongCat技术升级!注意力机制解码速度快10倍,还能处理1M超长文本

美团龙猫LongCat系列发布全稀疏注意力机制LoZA,重点解决长文本任务难题。它在MLA机制基础改造,计算复杂度降至线性,处理128K上下文解码快10倍,性能不缩水,后续还计划支持动态稀疏比例。

量子位
新闻资讯7

您猜怎么着?Grok 4进决赛,大模型对抗赛Gemini全军覆没,马斯克「装」起来了

谷歌举办的 Kaggle AI Chess 比赛中,半决赛 Grok 4 击败 Gemini 2.5 Pro 进决赛,o3 也战胜 o4 - mini 晋级。Grok 4 与 Gemini 2.5 Pro 对决焦灼,最终 Grok 4 涉险晋级,明天将与 o3 争夺冠军。

机器之心
新闻资讯7

Altman 秀模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝 3 天,编程再赢老东家模型!

近期,OpenAI 携多款未公开模型亮相。在 IMO 竞赛中,其宣称模型获金牌,谷歌 DeepMind 的 Gemini Deep Think 也达金牌水平,但网友对二者评价不一。此外,‘o3 Alpha’疑上线,前 OpenAI 员工还在编程赛中击败 OpenAI 模型。

InfoQ
算法论文8

清华框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

清华等团队提出全框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供范式。

量子位
算法论文8

奖励模型预训练范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”

强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。

OpenMMLab