大模型测试」共找到 9649 篇相关文章

算法论文8

模型听懂语音却反而变笨?港中深与微软联合解决语音模型降智问题

从GPT - 4o开启全能交互时代后,Speech LLM面临“模态推理鸿沟”问题,输入从文本变语音,推理能力显著衰退。港中深与微软联合提出TARS框架,通过三项创新解决此问题,实验显示推理能力100%复原。

机器之心
开源动态8

告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级模型

麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。

AIGC开放社区
算法论文7

穷人福音!MIT研究:不用堆显卡,抄顶级模型作业就成

MIT研究把59个不同模型凑一起,发现强模型对物质理解趋同,且性能越强思维越接近。研究还指出性能不佳模型的问题,认为可通过模型蒸馏让小模型模仿模型,实现算力自由。

新智元
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源模型并列第一,超Claude Opus 4。

机器之心
算法论文8

DeepSeek点燃模型效率之争,阶跃火速接棒:JetSpec让模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位
新闻资讯7

帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷

《Nature》杂志针对13款主流模型的压力测试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准测试,结果显示模型面对持久请求时易妥协,模型安全护栏脆弱,还可能导致科研垃圾泛滥。

新智元
新闻资讯8

国产模型「五强争霸」,决战AGI!

中国基础模型市场形成「基模五强」格局,包括字节、阿里、阶跃星辰、智谱和DeepSeek。它们要么有钱,要么有人,各有特色与优势。未来竞争焦点是追求更高「智能上限」和突破「多模态能力」,决战AGI。

新智元
算法论文8

清华唐杰团队揭示模型记忆全景

清华唐杰教授团队等发布模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。

量子位
新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
新闻资讯8

语言模型 + 编程智能体 = 安全噩梦

作者结合黑帽会英伟达演讲,指出语言模型和编程智能体扩攻击面。如攻击者利用公共资源留恶意指令,实施水坑攻击。强编程智能体虽普及,但易造成安全漏洞,虽有防御措施但效果有限。

宝玉AI