「Skill训练框架」共找到 3736 篇相关文章
王阳明心学,被Anthropic用来教Claude做人了
UT Austin哲学教授Harvey Lederman研究王阳明心学十年,现加入Anthropic做Claude对齐训练。他用分析哲学拆解“知行合一”,发现AI模型存在“信念冲突”,Anthropic用类似阳明心学方法解决问题。如今硅谷AI公司争抢哲学家。
没想到,又一个Code Agents瓶颈,被美团&上交大彻底撕开了~
AI写代码能力提升,但打分方法僵化且成本高。上交大与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。
腾讯出手,第一个小龙虾安全管家它来了。
腾讯推出首个专为OpenClaw打造的小龙虾安全管家,集成于腾讯电脑管家。该管家功能全面,涵盖Skills安全检测、文件保护等,解决了AI安全痛点,是适合普通人的安全方案。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
「熟悉的陌生人」才是「好老师」?复旦提出简单指标,找出推理蒸馏中真正有教学价值的数据
复旦大学和上海人工智能实验室研究者提出 Rank - Surprisal Ratio (RSR) 度量方法,综合考虑样本信息量与对齐程度,在蒸馏实验中与学生模型后训练性能相关性高,可用于筛选推理轨迹和选择教师模型。
刚刚,字节开源Seed-OSS-36B模型,512k上下文
深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。
这个AI精准模拟人类行为大脑状态,上Nature了
德国团队开发出人类认知通用计算模型Centaur,登上Nature。它基于Llama 3.1 70B,用5天训练,参数仅Llama的0.15%,能模拟人类在160项实验中的行为,性能超传统模型。
20种机器人本体通吃!蚂蚁新一代VLA具身大脑刚刚开源了
2026 年具身智能 VLA 受关注,蚂蚁灵波发布新一代具身基座模型 LingBot-VLA 2.0,支持 20 种机器人构型,多方面能力提升,开源模型权重等,从架构、数据、后训练解决跨本体难题。
跨越落地鸿沟!清华长三院发布首个真实场景AI竞技场,实战谁是最佳?
2026年AI产业冰火两重天,清华长三角研究院发布RWAI开源框架与“真实场景AI竞技场”。RWAI还原真实交互,实践效率高。竞技场重实际效能,产生多个赛道“擂主”,降低产业AI落地试错成本。
第一个同时为人类和Agent设计的AI视频产品,它叫,LibTV。
Liblib推出的AI视频产品LibTV,是首个为人和Agent共同设计的产品,用优雅姿态解决兼顾专业与普通用户的难题。它面向人类的是无限画布,功能强大;面向Agent的是简单的Skills。