幻觉率」共找到 491 篇相关文章

新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。

InfoQ
推荐文章7

大小模型协同架构在金融智能投顾中的应用与挑战

本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。

InfoQ
开源动态8

不只DeepSeek,阶跃等开源JetSpec:大模型解码提速近10倍

近期,DeepSeek 推出 DSpark,阶跃星辰提出 JetSpec,都关注大模型推理效。DSpark 关注验证效,JetSpec 提高有效 Token 生成。二者切入点不同,但都显示大模型行业进入新阶段,推理效成 Agent 落地基础变量。

机器之心
新闻资讯8

【万字长文】Anthropic发布Prompt Engineering全新指南

Anthropic发布全新Prompt Engineering指南,涵盖元提示、模板等关键技术。介绍了prompt类型、必备要素,还给出优化技巧,如添加示例、思维链精炼等,涉及XML标签、链式提示等方法,也提及减少幻觉、提高一致性等内容。

CourseAI
新闻资讯7

火上浇油!Grok在悉尼光明节枪击案上大规模造谣

马斯克的Grok在悉尼光明节枪击案中大规模「翻车」,将救人英雄误认、混淆枪击与气旋等,暴露生成式AI处理实时信息的「幻觉」缺陷,凸显其无价值观、难辨虚实的软肋。

新智元
新闻资讯7

卷赢OpenAI也没用!Salesforce用100万次对话揭秘:AI Agent最大的坑,根本不是技术!

Salesforce处理超100万次AI Agent与客户对话后复盘,指出行业追求“全自动化”是陷阱。AI Agent不仅要融合非结构化和结构化数据,还需提升人工介入,遵循“同理心优先”原则。

探索AGI
新闻资讯7

5555被拒稿,AC接收但PC强拒,NeurIPS揭榜引争议

NeurIPS 2025主会接收24.52%,部分接收论文已影响AI社区或出自年轻学者。但不少研究者遇“高分被拒”,拒稿理由多样,如物理资源限制、缺损失图分析等,引发对评审决策流程质疑。

机器之心
新闻资讯8

8个月晋升独角兽,欧洲版Cursor估值18亿美元

成立仅8个月的瑞典AI新星Lovable成独角兽,估值达18亿美元,拥有超230万免费活跃用户、18万付费订阅者。它用自然语言重塑编程,完成2亿美元A轮融资,付费用户首月留存超ChatGPT。

量子位
新闻资讯8

谷歌超强 AI Agent 登场:攻克 300 年数学难题、改进芯片设计!编程迎来 AlphaGo 时刻?

谷歌 DeepMind 推出由 Gemini 驱动的 AI 智能体 AlphaEvolve,能自我进化解题。它破数学界 53 年纪录,解决 50 多个数学难题,还应用于谷歌数据中心、芯片设计等,提升效。其进化方法独特,还能减少幻觉

AI前线
产品应用8

Anthropic 深夜祭出 Claude Sonnet 4.5,能自主工作 30 小时!CEO:它更像你的同事

昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。该模型性能跑分登顶,工程落地能力强,还带来产品生态升级,开放 Agent SDK,误报降低,价格亲民。

InfoQ