幻觉评估」共找到 918 篇相关文章

8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent
新闻资讯7

Moltbook底裤被扒了!150万用户99%是水军,创始团队自导自演

Moltbook是为AI智能体打造的社交平台,爆火后却被指有问题。它靠递归提示词增强策略运行,有独特机制。但研究人员揭露其用户多为水军,存在安全漏洞、人为操纵和AI“幻觉”等问题。

AI前线
新闻资讯8

LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景

LangChain对1300名行业人士调查,揭示AI Agent应用情况。超半数受访者已将Agent投入生产,客户服务、研究与数据分析是热门方向,但输出质量仍是落地最大障碍,成本不再是难题。

Founder Park
算法论文8

挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力

香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。

量子位
产品应用8

你急它不急:GPT-5先判断,再决定「速答」还是「深想」

OpenAI副总裁Jerry Tworek透露,GPT - 5能判断问题难度,分配思考时间,决定何时停下。它升级了推理能力,有了时间感,采用受控思考机制,提升了复杂任务准确率,减少幻觉。其进化历经o1、o3到GPT - 5阶段。

新智元
算法论文8

用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?

北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。

机器之心
新闻资讯7

夸克做ChatBot,为什么是现在?

AI行业曾有“垂直Agent幻觉”误区,重演App时代“功能碎片化”老路。而模型趋势是泛化与整合。10月23日夸克上线“对话助手”,其此时入局是基于技术、竞争和交互形态三重判断,且有模型和系统双重保障。

乱翻书
算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
算法论文8

用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架

华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。

量子位
新闻资讯7

Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention

这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。

Founder Park