测试时路由框架」共找到 3168 篇相关文章

算法论文8

提速30倍,Meta重新定义了新一代RAG!

LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。

PaperAgent
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
开源动态8

又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了

Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。

AIGC开放社区
算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
算法论文8

哈工大最新研究AI Meets Brain

传统大模型有“健忘”问题,哈工大《AI Meets Brain》研究借鉴人类记忆机制,为AI智能体打造强大记忆系统。研究涵盖核心洞察、记忆形态、分类框架等内容,还探讨了记忆赋能方式及未来发展方向。

CourseAI
算法论文7

Google 新论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。

Google新论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。

探索AGI
算法论文8

只演示一次,机器人就会干活了?北大&BeingBeyond联合团队用“分层小脑+仿真分身”让G1零样本上岗

北大与BeingBeyond团队提出DemoHLM框架,仅需1次仿真演示就能生成海量训练数据,解决人形机器人移动操作数据效率低、任务泛化差、Sim-to-Real迁移难的问题,在仿真和真实机器人上验证效果良好。

量子位
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
算法论文8

CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源

中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。

机器之心
开源动态7

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

DeepSeek官方版Harness未出,民间开源编程Agent「Pi」先火。它适配DeepSeek,让其缓存不命中率低至0.03%,调用成本大降。Composio测试显示Pi完成任务平均成本最低。同时,DeepSeek正组建团队做官方Harness。

量子位