「测试时微调」共找到 2499 篇相关文章
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起
知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。
Karpathy头疼的“AI游戏困境”,被这款15分钟出包的国产神器破解了
8月初Andrej Karpathy指出通用AI做游戏时,LLM无法高效审查工作的弱点。而国产平台Spellcaster能先解析自然语言确定游戏设计,15分钟出包,还内置测试员验证,团队想工程化落地新方向。
AI模型守法率提升11%,港科大首次用法案构建安全benchmark
香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。
推理token减少46%!Meta新方法缩短思维链,告别重复推导
Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。
BLIP3-o统一图像生成与理解,多模态融合趋势显现
BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。
一码难求的 Dia 浏览器,有了新进展
Dia 浏览器处于 Alpha 内测,需邀请码体验。测试反馈超预期,将打磨细节后发布。其优势是使用 AI 时能方便代入上下文信息,Chat 交互将成主流,Arc 部分功能会融合进 Dia。
建模世界偏好:偏好建模中的Scaling Laws
研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。
10%训练数据超越100%表现,机器人学习领域迎来重要突破
密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。