事实准确性」共找到 135 篇相关文章

算法论文7

The Batch: 896 | 教会模型说出真相

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。

DeeplearningAI
产品应用8

Nano Banana Pro最全解析,设计师和开发者都用得上,附官方提示指南

Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理能力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间。

AIGC开放社区
算法论文7

ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍

LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。

深度学习自然语言处理
开源动态8

告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher

过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。

机器之心
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在多项测试中的亮眼成绩。

InfoQ
产品应用7

Excel新AI插件!华尔街「表哥表姐」对手来了

Anthropic让Claude以插件形态接入Excel,可操作和读取数据、定位单元格内容并说明修改理由。还针对金融领域新增6项技能。Claude已被金融企业广泛使用,或取代金融从业者制表技巧,但核算准确性存疑。

新智元
推荐文章7

上下文就是一切!行业热议话题:提示工程是否应该改名

AI圈热议提示工程是否应改名“上下文工程”。Shopify CEO等发表看法,指出其在LLM应用和AI Agent构建中很重要,还分析了重要性、优化方法,给出实践经验,强调要在性能、成本和准确性间平衡。

歸藏的AI工具箱
算法论文8

CMAME | 西安交通大学海春龙、梅立泉等:基于分层神经网络的在线多保真度数据融合

在工业应用中,高保真数据获取成本高,低保真数据准确性不足。本文提出基于分层神经网络的在线多保真度数据融合方法(OMA - HNN),含MA - HNN和在线渐进采样框架,经测试验证了其有效性和实用性。

力学与人工智能
算法论文8

句子级溯源+生成式归因,C²-Cite重塑大模型可信度

在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。

机器之心
新闻资讯7

维基百科,终结了!马斯克开源版上线,用AI重写「真相」

马斯克发布开源版「维基百科」Grokipedia V0.1,称其足以秒杀维基百科。它收录超88万篇文章,通过Grok核查事实,支持交互、申报错误。但上线后遭质疑抄袭,也有好评,维基百科受AI搜索冲击,需翻身。

新智元