「后训练框架」共找到 4961 篇相关文章
3D生成告别「穿模」噩梦!VASTx清华将蒙皮权重Token化,统一生成骨骼与权重,GRPO微调形变平滑
3D模型生成容易,让它“动起来”难,传统AI蒙皮算法有局限。SkinTokens研究将蒙皮权重离散化,构建TokenRig框架,引入GRPO算法,提升了AI自动绑定精度和泛化能力,助力3D动画自动生产。
王阳明心学,被Anthropic用来教Claude做人了
UT Austin哲学教授Harvey Lederman研究王阳明心学十年,现加入Anthropic做Claude对齐训练。他用分析哲学拆解“知行合一”,发现AI模型存在“信念冲突”,Anthropic用类似阳明心学方法解决问题。如今硅谷AI公司争抢哲学家。
没想到,又一个Code Agents瓶颈,被美团&上交大彻底撕开了~
AI写代码能力提升,但打分方法僵化且成本高。上交大与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
刚刚,字节开源Seed-OSS-36B模型,512k上下文
深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。
这个AI精准模拟人类行为大脑状态,上Nature了
德国团队开发出人类认知通用计算模型Centaur,登上Nature。它基于Llama 3.1 70B,用5天训练,参数仅Llama的0.15%,能模拟人类在160项实验中的行为,性能超传统模型。
Stripe为什么买OpenRouter?
Stripe愿花超70亿美元收购OpenRouter,因看清路由权即定价权。OpenRouter掌握AI请求分配权,能转化为议价权。Stripe不满足原有支付模式,收购后有望接管AI请求全链条结算。
跨越落地鸿沟!清华长三院发布首个真实场景AI竞技场,实战谁是最佳?
2026年AI产业冰火两重天,清华长三角研究院发布RWAI开源框架与“真实场景AI竞技场”。RWAI还原真实交互,实践效率高。竞技场重实际效能,产生多个赛道“擂主”,降低产业AI落地试错成本。
龙虾之父Claude账号被封!近百万人围观:故意的还是不小心的
Anthropic状况频出,先是泄露源代码、词元计费有BUG等,现又封了龙虾之父Peter的Claude账号,后称是误伤解封。此事引发近百万人关注,有人质疑A社在炒作。
AIA | 西工大马启悦,高传强等:物理指导的激波抖振抑制翼型优化设计研究
激波抖振影响飞行品质、限制飞行包线。本文提出物理指导的气动优化设计框架,基于DDPG算法,优化RAE2822翼型激波位置与分离区范围,提升抖振起始边界,改善综合气动性能。