「验证预算」共找到 898 篇相关文章
7,700+ star 微软 SkillOpt 可以训练的Skill
微软研究院开源了SkillOpt(7700+ star),把Skill文档当成‘可训练的权重’来优化。它有独特的6阶段流水线、核心验证门控、Protected Regions机制,还有SkillOpt - Sleep预览功能,让Skill文档可系统化训练。
5Y View|欢迎来到评测时代
强化学习推动AI突破,模型将刷爆既有评测,AI实验室面临评测饥荒。构建评测与RL环境是利用人类时间的高效方式,不同领域有不同验证方式,Mercor已率先拓展RL数据边界。
直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?
论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。
JCP | 南科大赵肃楠、王建春等:LESnets:基于物理信息神经算子的湍流大涡模拟
本研究提出基于物理信息神经算子的LESnets方法,用于快速模拟粗网格上三维湍流时空演化。不使用标签数据,训练两种神经算子,验证了其有效性和泛化能力,效率显著优于传统方法。
登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。
ICLR 2025 Oral | LLM也有从众心理!
浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。
UIUC清华微软联合提出PlugMem:当Agent记忆告别「经历」,开始存储「经验」
随着大语言模型Agent长期运行,‘记忆该如何设计’成核心问题。UIUC、清华、微软联合提出PlugMem,将记忆拆分为三类,以知识为单位存储,在三类任务中验证其有效性,为Agent长期记忆设计提供新思路。
审美在线、随叫随到、月薪19刀——Lovart把AI设计师这件事做认真了
Lovart适合无设计预算的人,将专业设计师装进AI工具。其Brand Kit解决风格不稳定问题,Font Generator可生成专属字体,Create Skill能固化学习成本,还有Export PSD、Mock Up等实用功能,月费仅19美元。
一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题
DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。
构建 Claude Code 的经验:我们如何使用 Skills
本文来自Anthropic内部团队,总结构建Claude Code使用Skills的经验。介绍Skills类型,如库与API参考、产品验证等;给出编写技巧,涵盖避免说废话、建踩坑点章节等;还提及分发、管理及衡量效果的方法。