「实验结果」共找到 1739 篇相关文章
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
3D高斯泼溅,可输入视图量高达500!推理速度提升3倍,内存少80%
ZPressor能高效压缩3D高斯泼溅(3DGS)模型的多视图输入,解决其在处理密集视图时的性能瓶颈。它基于信息瓶颈原理,分三步压缩信息,降低内存占用和推理时间,提升3DGS在高视图输入下的性能。
陶哲轩转发!华人数学博士后反超DeepMind AI,停滞18年数学问题1个月内3次突破
DeepMind的AlphaEvolve打破集合和差问题18年纪录,华人博士后Fan Zheng等数学家出手反击。人类用测度集中性少量辅计算机,1个月内该问题3次突破,陶哲轩称不同方法可互补推动数学进步。
推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源
DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。
音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造
南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
OpenAI新模型让数学家集体破防?一场关于数学未来的精神危机
OpenAI下一代主要模型Astra内部版本在多数学领域给出十项新研究结果,让数学界震动。数学家看法不一,有人惊叹,有人迷茫,还有文章指出这或引发数学学科意义的精神危机。
让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍
文章聚焦让VLA模型在机器人上高效运行难题。北大等团队提出Jetson - PI方案,从异步推理算法等三层面优化,在Jetson Orin上控制频率提升8.66倍,推动具身智能向工业应用跃迁。
蒸馏效果起飞!DOPD破解「特权幻觉」,让在线策略蒸馏更有效
近期,新加坡国立大学等团队提出 DOPD 法解「特权幻觉」难题。该法依 token 情况动态蒸馏,实验表明其在 LLM、VLM 蒸馏效果好,鲁棒性强,训练稳定,为在线策略蒸馏提供新思路。