「强化学习环境」共找到 1883 篇相关文章
万字拆解:Manus 的 PMF 到底是什么,以及谁在为它一直买单?
本文深入剖析 Manus,探讨其 PMF。分析其使用场景、产品价值,对比与 ChatGPT 差异,勾勒核心用户画像,还发现 AI 工具分工、用户消费特点等,指出 AI 竞争关键,阐明 Manus 边界与行业机会方向。
Meta&UIUC大发现:无需标注,Agent复杂的工具使用和搜索能力,是可以“无中生有”的
Meta和UIUC研究发现,无需标注,Agent复杂工具使用和搜索能力可“无中生有”。论文Dr. Zero让大模型自我博弈成搜索专家,用HRPO提效,设计难度导向奖励,实验表现佳,但也存在局限。
NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?
深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。
十万美元的机械狗,正在“排泄”你的肖像!
迈阿密巴塞尔艺术展上,售价十万美元的《普通动物》由三只戴扎克伯格、马斯克和安迪·沃霍尔面具的机械狗组成,内置摄像头捕捉观众与环境,AI生成图像后“排泄”出实体作品,引发不同评价。
LeCun离职前的吐槽太猛了
年底将离开Meta的LeCun在播客直言,不看好大语言模型通往AGI,也吐槽Meta封闭。他将创办开源公司AMI研究世界模型,认为其与LLM本质不同,还回顾AI学习史引出JEPA架构。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
Khosla 继 OpenAI 后的最大赌注,General Intuition 凭 38 亿个游戏高光片段做世界模型
今年10月,General Intuition完成1.34亿美元种子轮融资,由Vinod Khosla领投。它从Medal分拆,有38亿游戏短视频片段,可赋予机器“直觉和物理常识”,与LLM互补,商业化将从游戏拓展到物理世界。
OpenAI深夜悄悄甩出GPT-5.1,称更热情,更智能!网友狂吐槽:我不想和它聊天,我想用它工作
OpenAI发布GPT - 5.1,含Instant和Thinking两版本,称更智能、对话更愉快,还增加“个性/语气”选项。但网友质疑“强化个性”方向,想要高效工具。业内认为拟人化是为提升用户体验和拓展应用场景。
ICCV 2025 Highlight | 大规模具身仿真平台UnrealZoo
北京多校联合团队推出具身仿真环境平台 UnrealZoo,基于虚幻引擎构建近真实三维虚拟世界集合,收录 100 余个 3D 场景。该成果被 ICCV 2025 接收,已开源,其易用接口可助力具身 AI 研究。
理解规范驱动开发:Kiro、spec-kit和Tessl
作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。