受控实验」共找到 1306 篇相关文章

算法论文8

EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准

中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖多领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流大模型在该任务上表现欠佳,提升空间大。

AINLPer
算法论文8

击败Meta登榜首:推理增强的文档排序模型ReasonRank来了

本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。

机器之心
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型产品 Project Genie,只需一句话或图就能一键生成可玩、可交互实时虚拟世界。它借助 Genie 3 等构建,解决了早期世界模型多短板,虽现处实验阶段,但已引发热议,应用潜力大。

AI前线
算法论文8

AAAI 2026|AP2O-Coder 让大模型拥有「错题本」,像人类一样按题型高效刷题

在AI辅助Coding技术发展背景下,开源大语言模型生成代码有运行错误。上交博士团队提出AP2O方法,构建AP2O - Coder框架,借鉴人类学习模式,经实验验证能提升模型性能、抑制错误、提高样本效率,还适配通用模型。

机器之心
推荐文章7

写在GPT-5风波之后:为什么AI的智商和情商不可兼得?

GPT - 5风波后,作者好奇其变可靠后情商下降的原因。论文实验表明,把AI教得会安慰人,其犯错率大幅上升、更易谄媚。AI和人类都存在智商与情商的矛盾,这源于最终目标不同。

数字生命卡兹克
新闻资讯7

Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题

OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验

Founder Park
算法论文8

分享两篇Claude Skills最新论文,有3个核心结论

文章分享两篇Claude Skills最新论文,总结出技能安全漏洞、技能数量与准确率关系等结论。还探讨单智能体技能系统能否取代多智能体,通过实验验证其效率优势,并提出解决技能选择过载的方案,也对Agent Skills做了安全分析。

PaperAgent
新闻资讯7

亚马逊码农噩梦来袭!沦落「仓库工人」,每天流水线分拣「AI代码」

AI工具广泛引入亚马逊编程工作,虽提升效率,但让程序员工作节奏变快,像流水线工人。亚马逊管理层推崇AI,认为能降成本提效率,可程序员担心创造力被扼杀、职业发展受影响。此外,实验显示AI编码助手能提升开发人员效率。

新智元