「实验评测」共找到 1864 篇相关文章
多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略
字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。
阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4
近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。
人大和微软开源Arbor,一棵假设树突破自主科研新高度
中国人民大学和微软研究者推出Arbor,它将实验挂到假设树,让研究信息跨周期保留。在六道真实研究任务中表现优异,增益超Codex和Claude Code,且成本相当,还能从失败中积累经验。
刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天
今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。
EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力
论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。
超越单文件代码生成:微软发布的ZeroRepo如何规划构建3.6万行大型软件?
微软等团队提出Repository Planning Graph(RPG),开发ZeroRepo框架,实现从零生成大规模代码库。RepoCraft基准实验显示,ZeroRepo功能覆盖率81.5%,代码近3.6万行,超现有基线,为AI驱动的软件工程开辟新路径。
为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学
上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核
近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。