幻觉评估」共找到 918 篇相关文章

开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集

上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位
算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
推荐文章8

AI 不会杀死初级开发者——但你的招聘策略可能会

文章指出在 AI 编码普及的行业,初级开发者角色转变但不可或缺。AI 虽自动化部分任务,却带来新挑战与期望。初级需培养新技能,避免过度依赖,公司也应调整招聘、培养和评估方式。

宝玉AI
新闻资讯7

AI杀死大学?教授ChatGPT教学逼疯学生,怒告学校讨要8000美元学费!

美国东北大学一名学生发现教授用ChatGPT生成课件,愤而起诉学校讨要8000美元学费。学生认为付高价学费应接受人类教导;教授则称AI可节省时间、充当助教。不同教授对AI使用看法不一,领英联合创始人看好AI在教育的应用。

新智元
产品应用8

破解300年数学难题,智能体大突破!谷歌发布超强AI Agent

今天凌晨谷歌Deepmind发布编程AI Agent——AlphaEvolve,它与Gemini深度集成,能评估算法。它解决了300多年的数学难题,还提出新算法,提升大模型计算效率,可优化GPU指令,架构含多模块。

AIGC开放社区
推荐文章7

RAG系统设计:揭秘语义搜索被低估的核心价值与KG驱动的架构选型策略

在AICon大会上,Hugging Face的尹一峰探讨基于语义搜索的RAG系统重要性,揭示其被低估原因,分析本质与作用,分享设计高效架构方法,还讨论KG驱动的RAG系统及范式选择。

AI前线
推荐文章7

面对MCP"工具投毒",我们该如何应对

近期MCP爆火但安全风险显现,安全机构指其有严重漏洞,会致‘工具投毒攻击’。本文介绍通过客户端/服务器代码复刻攻击过程,剖析MCP客户端和服务端安全风险,还给出阿里云的两种安全监控方案。

阿里云开发者
产品应用7

估值 20 亿美元的语音输入法,开源平替已经 3 万 star

文章指出语音输入随着 AI 发展价值重估,介绍了开源工具 OpenLess,分析了商业订阅、开源桌面工具、大厂输入法三类玩家,给出四层评估框架,也提及开源风险,并对不同需求给出选择建议。

AI Reading Hub
新闻资讯7

警惕全球“最大”芯片IPO的暴雷风险

Cerebras 5月14日上市成2026年迄今全球最大IPO。其核心产品WSE工程有突破,但良率计算方式与传统不同。训练未成功,推理找到新机会。与OpenAI超200亿美元合同背后是股权换订单,财务数据也有隐忧,上市后存诸多疑问。

芯师爷
产品应用8

AI PPT,这次是真不用返工了

过去AI做PPT虽快但有“幻觉数据”和“拼凑式模板”问题,被认为是高估需求。如今讯飞智文Vision Agent出现,能生成专业PPT,还解决了美观、内容等问题,将AI PPT带入2.0阶段。

量子位