「可验证评分机制」共找到 1672 篇相关文章
【CIKM'2026】CQ-SID:LLM生成式检索在手猫搜索召回中的探索与应用
文章围绕LLM生成式检索在手猫搜索召回的应用展开。先点明当前搜索召回机制问题及生成式检索挑战,提出CQ - SID等方法,经实验验证其效果佳,还介绍了线上实验成果,最后展望未来探索方向。
CNSNS|西工大曹文博、张伟伟:克服优化求解器中的损失条件数瓶颈:一种良性损失函数
基于优化的偏微分方程求解方法受关注,但实际慢于经典迭代求解器。本文从条件数角度审视效率瓶颈,指出标准MSE损失导致条件数平方放大、减缓收敛。提出稳定梯度残差损失SGR,在收敛速度与稳定性间建立平衡,实验验证其有效性。
让推荐学会思考:用强化学习激活大模型的序列推理能力
文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。
交互式世界模型来了:不止理解世界,更要改造世界
8月17日,智象未来发布交互式世界模型HiDream - O1 - World,定位为全球首款原生全模态交互式世界模型。它提供漫游和编辑两种交互方式,在WBench测试中成绩优异,但开放场景表现待验证。其采用独特生成方式,有广阔应用前景。
用超图撕开知识边界:16万节点无师自通搞Agentic科研
传统知识图谱只能用三元组描述世界,难以应对真实科学场景里的多体交互。作者提出将文献里n元关系存成超图超边,让LLM在多智能体框架里‘沿着超边走路’,并构建了超图进行实验,实现可验证的科学发现。
MoE RL 实战:统一 FP8 全流程训练
SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。
阿里:RL强化LLM推理,是技巧还是陷阱?
近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。
AI Code要变天了,Meta首个代码世界模型登场!
Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。
AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?
文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。