「通道依赖」共找到 485 篇相关文章
算法论文8
无需验证器的RL:RLPR解锁LLM通用推理潜能
现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。
深度学习自然语言处理
推荐文章8
AI x 保险图谱:第一家 AI-Native 的保险独角兽会长什么样?
保险业规模庞大但运营效率极低,超 60%流程依赖人工,索赔周期长、客户满意度低。过去两年,LLMs 提升了 AI 处理非结构化信息的能力,使 AI 接管保险核心流程成为可能。GenAI startup 围绕保险流程构建产品,AI-native 保险公司也应运而生。
海外独角兽
算法论文8
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
量子位
新闻资讯8
光掩模版:芯片产业的 “隐形胜负手”
光掩模版是芯片制造的“微观底片”,其制造流程复杂,精度要求达纳米级。全球市场规模持续增长,亚太占比超60%。中国企业已在部分环节突破,但仍面临高端设备依赖、材料瓶颈和人才短缺挑战。未来技术融合与国产化生态建设将助力产业发展。
芯师爷
算法论文8
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
新智元