「跨语言欺骗」共找到 1398 篇相关文章
突破单token预测局限!南洋理工首次将多token预测引入微调,编程任务准确率提升11.67%
当前主流大语言模型依赖下一token预测训练,难理解跨多token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将多token预测引入微调,能让模型理解完整概念,多领域实验显示其可显著提升模型性能。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
都标5美元,账单差三成!OpenAI高管:token从来没法直接比价
OpenAI Codex负责人Tibo指出,不同模型对同一段文字切分的token数不同,即便单token价格相同,最终账单也可能差异很大。他还提到,token无统一计量标准,跨厂商和新旧模型计数都难通用,真正重要的是每次成功结果的成本。
The Batch: 948 | GLM 5.1:面向长时任务的能力提升
Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。
“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!
近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。
RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘
近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。
95%的人还在手动提取数据,用这个工具秒变结构化
文章介绍Google开源的LangExtract,它基于大语言模型,能将非结构化文本转为结构化数据。有精准溯源、少样本定义等6大优势,可3步完成安装配置,还介绍基础使用、长文档处理、多模型支持及实战案例等内容。
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布
随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。