「从零训练」共找到 4909 篇相关文章
4D空间智能:AI如何一步步「看懂」时空结构?一篇综述解析通往四维世界的五大层次
4D空间智能重建整合静态场景与时空变化,构建含时间维度的空间表征系统。南洋理工等高校研究者调研该领域,提出按建构深度分五层的新视角,展现AI认知从基础到高阶的进化路径。
毕树超入职Meta后首发声:十年前怀疑AGI,如今深信AGI已至!
Meta超级智能团队成员毕树超回溯70年AI进化,称多数人低估AI影响,从怀疑到深信AGI已至。他阐述技术进展、难题与趋势,分享研究心路,回顾自监督学习、强化学习等发展,打破诸多机器学习误解。
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。
推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
千问 APP 再更新:为什么说「聊天」并不是 AI 产品的终点?
当前AI市场进入场景战役阶段,头部玩家都在去聊天化。千问APP此次升级,可在同一界面内完成办公场景从需求到成品的全流程,还覆盖多种模板,引入智能编辑器,是务实且有意义的探索。
向黄仁勋汇报的英伟达36人
市值第一的英伟达,有36人可直接向CEO黄仁勋汇报,他们分属七个职能板块。硬件是基石,AI等成第二支柱,公关团队配置特殊。介绍了关键将领,还提及管理模式从扁平到可能垂直化的转变及高压文化。
GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~
智谱继GLM-4.1V-9B-Thinking、GLM-4.5后,又开源最强多模态推理模型GLM-4.5V,在多模态理解榜单达开源SOTA。它视觉推理强,经测试能助力科研各阶段,还介绍了其架构设计与训练策略。
750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集
上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。