「测试时微调」共找到 2503 篇相关文章
LeCun的世界模型单GPU就能跑了
LeCun世界模型有新进展,开源极简训练方案LeWorldModel,单GPU就能跑,基于JEPA架构,速度快、参数小、控制强且懂物理,完胜此前JEPA方法,训练更简单。
一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,全网直呼疯狂
新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。
省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式
大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。
不用花Anthropic API的钱,本地跑Qwen3.5就能用Claude Code
文章介绍不花Anthropic API的钱,用本地Qwen3.5跑Claude Code的方法。包括选模型、编译安装llama.cpp、下载量化模型、启动本地服务、配置Claude Code指向本地服务等步骤,还提及踩坑建议和使用方法。
港大刚刚开源了 CLI-Anything!一个命令让任意软件秒变 AI Agent 原生工具!
香港大学数据科学实验室团队开源 CLI - Anything,它以 CLI 为桥梁,将人类软件转变为 Agent 能用的工具。该项目有一键生成 CLI、真实软件集成等亮点,还给出快速入手步骤和使用示例,未来规划宏大。
拖拽视频编辑进入流式时代!任意时刻、任意内容,实时修改 | ICLR'26
新加坡南洋理工大学和合肥工业大学研究人员在ICLR 2026提出REVEL任务,打造免训练DragStream方法,实现视频生成时实时拖拽编辑,支持多种操作,破解两大难题,实验显示效果、泛化性佳。
不止修bug:Agentic Coding评测走向复杂feature交付新阶段
中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。
AI Agent也有体检中心了?诊断级安全框架AgentDoG正式开源
上海人工智能实验室今日开源全球首个具深度诊断能力的AI智能体安全护栏框架AgentDoG。它能精准定位风险、解释决策成因。团队提出三维风险分类法,构建数据合成管道,实验表现领先,还集成归因模块。
斯坦福×英伟达发布AI推理新范式,刷新了多领域SOTA
斯坦福与英伟达联合发布论文 TTT - Discover,提出新范式,不追求通用,在推理阶段针对特定难题修改模型参数。它战绩辉煌,但成本高、是偏科生且需打分器,其出现是技术与哲学的突破。
学术海报不用愁,一句话精准自动编辑,华东师大开源APEX
华东师范大学Planing Lab提出APEX框架,能通过自然语言指令实现学术海报局部可控编辑,引入「审查—调整」机制提升可靠性。还构建APEX - Bench评估,实验显示APEX优于其他方法。