平庸答案」共找到 190 篇相关文章

产品应用7

搜索已死?被AI投毒搞怕了的我开始重新看待百度

作者辅导孩子背诗遇读音疑问,问AI结果更懵,百度则给出清晰准确答案且标注来源。原因在于AI基于大模型‘概率预测’易‘编答案’,百度用‘双层Agent’架构结合内容治理,答案更靠谱。

CourseAI
算法论文8

TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral

大模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。

量子位
算法论文8

无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!

论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。

深度学习自然语言处理
产品应用8

腾讯Omega:下一代“AI BI”的答案

本文介绍腾讯 Omega,它是为解决传统 BI 和 ChatBI 问题而设计的数据分析产品。Omega 能理解业务问题,生成完整 Dashboard,确保数据流动、安全和稳定,还支持人机协作,提供审美基础设施,性价比高,有完善运行时和监控推送等功能。

腾讯技术工程
推荐文章7

ADHD,反而成了 AI 时代的版本答案?!

文章探讨ADHD在AI时代的意义。ADHD大脑多巴胺调节回路有差异,过去被视为问题的特质如今成优势,如发散创造力、短时聚焦和混乱适应力。AI为ADHD带来新体验,让其更适合开荒。还分享在AI时代做ADHD的经验。

特工宇宙
新闻资讯8

性能真的不重要了吗?Jeff Dean给出反常答案

Google传奇工程师Jeff Dean更新文档《Performance Hints》,指出性能不是最后调出来的,而是写代码初始就注定的。很多人因对‘慢’无感、忽视性能,导致代码低效,顶级工程师则有‘物理地图’,能避开高成本路径。

新智元
算法论文8

对噢!为什么LMs就不能直接输出答案+confidence呢?

当前语言模型在复杂问答任务中存在校准退化问题,本文提出RLCR方法,将概率校准融入RL训练目标,重构奖励函数,在多个数据集实验中显著降低校准误差,不损失准确性,为高风险场景AI部署奠基。

深度学习自然语言处理
新闻资讯7

大模型能复刻这些系统吗?ProgramBench给出了残酷答案

斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。

AI工程化
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
推荐文章7

AI是「天才」还是「话术大师」?Anthropic颠覆性实验,终揭答案

Anthropic新研究证实Claude模型有一定内省意识,能控制自身内部状态。用「概念注入」实验,Claude Opus 4和4.1表现最佳。不过该能力不可靠、局限大,未来进化情况待察。

新智元