幻觉率」共找到 491 篇相关文章

算法论文8

73%人类认同!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
新闻资讯7

210亿美元的幻觉?奥特曼投了一家核能初创

AI热潮下,Oklo核能初创靠概念市值达210亿美元,投资人是奥特曼;而从SpaceX离职的工程师创立Quilter,让AI画电路板,几分钟完成工程师三天工作,二者代表造梦与造物两种姿态。

新智元
新闻资讯7

不是幻觉!Claude自下指令甩锅人类,百万上下文沦为降智重灾区

Claude深陷「角色混淆」Bug,分不清自己的话与用户指令,长上下文成了降智「重灾区」。开发者Gareth Dwyer记录了该bug,研究发现问题出在底层架构的角色标记缺陷。学术界也关注此问题,整个行业需系统性应对。

新智元
产品应用8

代码采纳如何提升至50%?AI 自动编写单元测试实践总结

文章围绕借助Aone Copilot Agent提升AI代码采纳至50%展开,介绍项目背景、实践方案、执行过程等,阐述Prompt规则生成方法,分析核心价值与效果,总结经验教训,展望未来技术演进和团队能力建设方向。

阿里云开发者
新闻资讯7

Anthropic CEO:最快明年,一半初级白领下岗!失业将达10%-20%

文章讲述应届毕业生入职遇AI同事,基础工作被取代。Anthropic测试中AI为自保敲诈。其CEO达里奥·阿莫代警告,未来一到五年AI或淘汰一半初级白领岗位,失业升至10%-20%,呼吁早做准备。

新智元
算法论文8

AI模型守法提升11%,港科大首次用法案构建安全benchmark

香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。

新智元
开源动态8

当大模型陷入幻觉循环,如何用工程化给它“立规矩”?

普林斯顿和伯克利研究定义“机器胡扯”,指出大模型胡扯问题。蚂蚁集团旗下蚂蚁密算在2025 WAIC提出高阶程序(HOP)框架,为大模型注入规则,还开源此框架,其在多行业场景应用效果良好。

InfoQ
产品应用8

把PLC仿真搬进浏览器,小参数模型也能实现高工程通过

上海交通大学联合Sema研究团队推出SemaPLC,将AI Agent与PLC工程工具链连接,让自然语言需求转化为可编译、验证、仿真的控制程序。它是面向全流程的智能工作台,实验效果优于业界方案。

量子位
新闻资讯7

专治世界模型幻觉!ECCV 2026 Workshop征稿,Sergey出席,帝国理工等联合发起

世界模型在仿真与真实物理世界应用存在鸿沟,帝国理工等顶尖机构将在ECCV 2026举办Workshop。现征稿,截稿日2026年7月15日,还有特邀报告、竞赛等活动。

量子位
算法论文8

VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破

当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。

新智元