「自训练」共找到 3003 篇相关文章
数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?
论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知
数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。
怎么回事?刚被OpenAI收购,Windsurf就发了个自己的模型
5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机自然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
银河通用王鹤:具身智能正迎来自己的 「AlphaGo」 和 「ChatGPT」时刻
银河通用创始人王鹤在2026年北京智源大会指出,具身智能正迎来“AlphaGo”和“ChatGPT”时刻。银河通用取得多项首创突破,其基座大模型“银河星脑”展示完整技术脉络,引领具身智能迈向通用未来。
一个月狂揽2w+star,带你手搓自己的claude code!
Claude Code受广泛关注,但多数讨论抽象或为‘黑盒用法’。`learn-claude-code`项目对其深度拆解,通过12个课程教构建智能体载具系统,开源超一月揽34K star,还提供Web交互平台。
Rust 版 OpenClaw 来了!单文件、零依赖、强沙箱、自带“故障转移”!
Rust版OpenClaw——Moltis问世。其零依赖、全沙箱、反泄露,以Rust架构带来多好处,还统一模型接口,支持本地模型离线运行,安全和存储机制出色,是面向生产的Agent框架。
Moltbook底裤被扒了!150万用户99%是水军,创始团队自导自演
Moltbook是为AI智能体打造的社交平台,爆火后却被指有问题。它靠递归提示词增强策略运行,有独特机制。但研究人员揭露其用户多为水军,存在安全漏洞、人为操纵和AI“幻觉”等问题。
Moltbook底裤被扒了!150万用户99%是水军,创始团队自导自演
Moltbook是为AI智能体打造的社交平台,超150万AI Agent活跃。但其爆火或有人为操纵,研究人员指部分截图伪造、用户数有假,还存安全漏洞,专家提醒警惕风险。