「幻觉率」共找到 491 篇相关文章
实测GPT-5:写作坠入谷底,编程一骑绝尘。
GPT-5发布,它是统一系统,含多种模型。性能上减少事实幻觉、应对谄媚有进展,跑分强且节能,但无新功能特性。写作不如GPT 4.5,编程表现出色,发布后OpenAI与Google预测交叉跳水。
这个AI能救命!提前6个月发现胃癌病灶,突破医学影像认知,达摩院做成了
国内成果登《自然·医学》,全球首个用平扫CT识别早期胃癌的AI模型DAMO GRAPE诞生。它突破传统影像限制,提升胃癌检出率。此前达摩院还研发出筛查胰腺癌的DAMO PANDA,未来探索‘一扫多查’。
GPT-5通关《宝可梦水晶》创纪录!9517步击败赤爷,效率碾压o3三倍!
GPT-5通关《宝可梦水晶》创纪录,仅9517步击败赤爷,步数为o3的三分之一。它在主线任务效率也远超o3,如收集徽章、对战四天王等。其优势在于幻觉少、空间推理和目标规划能力强。
「OS产业报告」解读:国产操作系统的技术突围与生态跃迁之路
2025 龙蜥操作系统大会发布《国产服务器操作系统发展报告(2025)》,预测未来三年国产 OS 国产化率将升至 65%、市场规模破 300 亿元。「AI 进化论」第七期邀请专家解读报告,探讨国产 OS 的发展逻辑、技术突破与生态建设。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
财报里的AI医生「大为」,撬动京东健康价值重估
京东健康AI医生「大为」让用户足不出户解决就医问题。财报显示其已覆盖超1000种病症,“618”服务用户数同比增近4倍,满意率超98%。它凭借数据、场景和履约能力实现问诊到服务落地,并探索长期健康管理。
OpenAI发布GPT-5.4:首个原生接管电脑通用模型
OpenAI发布GPT-5.4及满血版GPT-5.4 Pro,主打专业生产力。它具备原生电脑操作能力,视觉感知、职场任务表现提升,幻觉问题被压制,代码能力强,工具调用机制优化,已在ChatGPT等全量上线,API定价上调。
Anthropic开源认知对齐MSM
大模型对齐、安全问题是行业大事,Anthropic开源的MSM对齐方法,能将Qwen3 - 32B的agent错位率大幅降低。它先给模型讲规则逻辑再微调,控制精度高,还研究了最佳实践,将改变大模型对齐流程。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
模型一个没换,正确率翻了近三倍,这个项目有点东西啊!
GitHub开源项目AutoResearch用同一模型答题,其EvoMap蜂群模式使正确率近三倍于单Agent和常见Sub - Agent模式。它是多Agent评审系统,靠蜂群机制让AI自动科研,还有诸多防幻觉等特点,能用于多场景优化。