「训练环境」共找到 2523 篇相关文章
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026
西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。
数据合成有没有未来?事实结论来了
有人认为用大模型合成数据可快速生产,无需人工标注。但作者观察发现人工标注不仅必要且要求更高。以Scale AI、Surge AI为例说明标注价值,还展示‘智能知识’团队对两数据集审查结果,证明高质量数据需专家和管理流程。
Rust 版 OpenClaw 来了!单文件、零依赖、强沙箱、自带“故障转移”!
Rust版OpenClaw——Moltis问世。其零依赖、全沙箱、反泄露,以Rust架构带来多好处,还统一模型接口,支持本地模型离线运行,安全和存储机制出色,是面向生产的Agent框架。
中美安全公司经营对比及原因分析
国内网络安全上市公司财报多显示亏损,而美国同类公司增长与盈利能力强。分析指出,差距源于市场国际化、产品能力和人的因素。国内市场内卷,产品竞争力弱,部分公司决策和态度存在问题。
Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫
沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。
中国AI芯片如何破局?这家公司重注推理芯片
2月3日,云天励飞董事长陈宁在战略前瞻会表示要All in AI大算力推理芯片,打造“中国版TPU”。他认为2025 - 2035年是推理芯片高光时刻,还介绍了公司技术壁垒、差异、战略及生态等内容。
Anthropic 新研究:AI出错是“热混乱”
Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。
SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了
3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。
北大校友、华人学者金驰新身份——普林斯顿大学终身副教授
华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。