大模型评估」共找到 9355 篇相关文章

算法论文8

VLA模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA模型记性是短板,处理非马尔可夫任务常束手无策。同济学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
新闻资讯7

GPT-5.2考赢人类!OpenAI警告:模型能力已过剩,AGI天花板不是AI

GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。

新智元
算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北团队用CoV-Eval评测20款主流模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。

深度学习自然语言处理
开源动态8

OpenAI深夜开源HealthBench,60个国家合力开发5000段真实对话

今天凌晨1点30,OpenAI开源医疗模型测试评估集HealthBench。其5000段核心测试对话由60个国家/地区的262名医生打造,采用多轮对话测试。测试显示模型在医疗保健领域表现显著提升,还介绍了其构建及评估等情况。

AIGC开放社区
算法论文8

普林斯顿学等Nature揭秘:人类脑与语言模型共享同一套语言处理时钟

普林斯顿学等机构研究发现,语言模型层级计算序列精确映射人类脑处理语言的毫秒级时间动态,其与人类脑理解语言的先后顺序高度一致,为理解脑和开发神经网络架构开辟途径。

AIGC开放社区
新闻资讯8

首家央企AI独角兽浮出水面!背靠自研模型,4家国家队资本背书

中电信人工智能科技(北京)有限公司成为央企首家AI独角兽,完成首轮增资,引入四家国家级战略投资方。其靠自研“星辰”系列模型,在多领域突破,实现技术与市场认可闭环,有望推动AI产业落地。

量子位
算法论文8

上科何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」

上海科技学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。

AI科技评论
推荐文章8

深度解析模型技术演进脉络:RAG、Agent与多模态的实战经验与未来图景

模型作为产业变革核心引擎,RAG、Agent与多模态技术重塑AI与现实交互边界。本文解析技术演进脉络、实战经验与未来图景,介绍三者在各领域应用及面临挑战,为产业升级提供指引。

腾讯技术工程
算法论文8

名师一定出高徒?清华团队最新揭秘:别再迷信模型蒸馏的「免费午餐」

当下模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。

机器之心
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态模型

多模态语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理