「训练策略」共找到 2783 篇相关文章
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
1美元训出专属滤镜,AI把ASCII游戏画质拉满
软件工程师Jeff Schomay用AI将ASCII风格游戏‘雷霆蜥蜴’实时‘翻译’成全动态图形游戏。他借助fal.ai平台解决速度问题,经历多次尝试平衡速度与画质,还训练专属LoRA模型提升画质,但仍面临帧间一致性难题。
「All in AI」的 Shopify,分享了他们的全员 AI 落地实践,全是干货
Shopify 三个月前决定「All in AI」,副总裁 Thawar 分享公司引入 AI 的策略、提升效果与三个「反直觉」见解。如全员无差别用 AI、让 AI 展示思考过程、重视新手等,还给出多个工作流案例。
机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025
美国东北大学和波士顿动力RAI提出HEP框架,首创“坐标系转移接口”,有极简高效分层结构、空间对称性自然泛化、创新型体素编码器等亮点。它基于分层策略和接口,提升机器人操作灵活性与泛化性,论文被ICML2025收录。
4人团队,连做两款AI教育爆款,AI时代小团队创业取胜指南
Oleve是仅4人AI创业公司,年化收入达600万美元。旗下Quizard和Unstuck AI成爆款。其成功在于技术敏锐,用OpenAI Codex起步;有“精益增长”策略;且实现流程全面自动化,为小团队创业提供样本。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
Learning from peers!让LRM互相「传纸条」的新协作方式大幅提高准确率和效率
当前主流大模型如QwQ - 32B存在“前缀主导陷阱”,推理开头出错会使准确率暴跌。研究者受“同伴互助”启发提出LeaP框架,设计三种路由策略,实验显示小模型能借此超越大模型,开创了多种可能性。
Anthropic最新论文:检测LLM内省意识的方法
Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。
Agent-World:扩展真实世界环境,让智能体与环境协同进化!
文章提出Agent-World,将“智能体环境探索”与“自进化训练”结合,构建了1978个环境、19822个工具。实验表明,其在23个基准上一致性优于先进方法与强开源基础模型,还分析了环境规模与自进化对性能的影响。