幻觉评估」共找到 918 篇相关文章

算法论文8

AI编程真面目:完整项目通过率仅27% | 上交大新基准

多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。

量子位
新闻资讯7

实测GPT-5:写作坠入谷底,编程一骑绝尘。

文章记录了GPT - 5的发布情况,介绍其系统构成、减少事实幻觉和谄媚行为等改进,也提到跑分、性格设置等。实测发现写作和情商不如GPT - 4.5,但编程能力强,还感慨AI发展之快。

数字生命卡兹克
开源动态8

中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024

中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据集,表现出色。

深度学习自然语言处理
算法论文8

数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?

论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。

深度学习自然语言处理
新闻资讯8

医疗AI质变时刻来临!国产医疗AI率先突破,临床诊疗能力问鼎全球

文章指出当前医疗AI真实能力与临床期待有落差,为此中国医生联合制定全球首个评估医疗AI临床适用性标准,完成对主流模型测评,中国企业打造的MedGPT夺冠,还推出‘未来医生’平台服务患者。

量子位
新闻资讯7

AI 颠覆的第一个职业是程序员?|GAIR Live

文章围绕“AI颠覆的第一个职业会是程序员吗”展开讨论。嘉宾认为AI Coding尚处早期,有潜力成新工程范式。它面临“幻觉”、上下文窗口限制等瓶颈,未来开发者角色或转变为“业务翻译者”和“需求架构师”。

AI科技评论
新闻资讯8

马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜

马斯克发布Grok 4.1,同时霸榜大模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。

量子位
产品应用7

不再迷信Hackathon,把Agent推翻重做了4次!Notion负责人复盘:做AI产品如何避免“逆流而上”?

Notion负责人复盘Agent开发历程,指出AI替代的是流程。他们将模型、产品和权限接入同一框架,历经多次重构,还探讨了组织管理、评估体系、软件工厂等内容,分享对CLI和MCP的看法及产品定价策略。

AI科技大本营
产品应用7

专治AI生图「人脸崩坏」,8倍速碾压GPT!新版FLUX.1多方位刷新SOTA

FLUX.1 Kontext是融合即时文本图像编辑与文本到图像生成的新一代模型,支持文本与图像提示,角色一致性强,速度快达GPT - Image - 1的8倍。它能解决AI生图“人脸崩坏”等问题,评估显示性能优异。

新智元
产品应用8

GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了

GPT-5.2登场,有即时版、思考版与专业版。它在多方面大幅升级,能碾压44类专业工作。经济性强,编程能力佳但速度慢,还自评‘最优科研模型’,幻觉现象减少。今日起推送,优先面向付费用户。

InfoQ