大模型技术」共找到 10342 篇相关文章

算法论文8

模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
算法论文8

VLA模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA模型记性是短板,处理非马尔可夫任务常束手无策。同济学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
新闻资讯8

只剩5年?诺奖得主Hassabis放出AGI时间表:还差一两个技术突破

诺奖得主、Google DeepMind掌门人Demis Hassabis给出AGI终极时间表,认为5年内或需1-2项重技术突破就能跨越障碍。他指出模型有局限,实现AGI需“世界模型”和“智能体系统”,还称AI将加速科学发现,中国AI模型距美国仅差数月。

新智元
新闻资讯7

GPT-5.2考赢人类!OpenAI警告:模型能力已过剩,AGI天花板不是AI

GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。

新智元
算法论文8

普林斯顿学等Nature揭秘:人类脑与语言模型共享同一套语言处理时钟

普林斯顿学等机构研究发现,语言模型层级计算序列精确映射人类脑处理语言的毫秒级时间动态,其与人类脑理解语言的先后顺序高度一致,为理解脑和开发神经网络架构开辟途径。

AIGC开放社区
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态模型

多模态语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理
算法论文8

68页论文再锤模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位
算法论文8

一个省略号提示+强化学习搞定模型“过度思考”,中科院自动化所新方法:从强制推理到自主选择

中国科学院自动化研究所联合鹏城实验室提出AutoThink方法,用省略号提示和多阶段强化学习,让推理模型依题目难度自主切换思考模式,解决过度思考问题,在多数据集验证有效。

量子位
开源动态8

百川开源医疗增强模型 Baichuan-M2:更符合中国临床诊疗场景,可 4090 单卡部署

百川智能发布并开源医疗增强模型 Baichuan-M2,以更小尺寸反超 OpenAI 新模型。它可 4090 单卡部署,成本低,在 HealthBench 评测表现佳,免费开源,更适配中国临床诊疗场景。

InfoQ
算法论文7

OpenAI谈:模型为什么会有幻觉?如何避免?

OpenAI论文探讨模型幻觉问题,指出评测缺陷,像多数AI模型评测非对即错,模型为得分会瞎猜。还从预训练和后训练阶段剖析根源,提议改造评测,引入置信度阈值和错误惩罚机制。

探索AGI