「3D世界生成」共找到 4444 篇相关文章
极佳科技朱政:世界模型会进化成 VLA 的下一代|具身先锋十人谈
具身智能领域数据难题待解,极佳科技朱政投身世界模型研究。他认为世界模型短期内是‘驯化’VLA的容器,长期或与VLA融合。其团队成果显著,还将探索多维度建模与数据配比优化。
ICCV 2025 | SeaS: 工业异常生成+正常合成+精准掩码大一统框架,指标全面碾压SOTA
华中科技大学慢工团队提出少样本工业生成模型SeaS,依托U-Net,只需1 - 3张训练样本,单模型同步实现多样异常生成、正常产品合成及精确异常掩码标注,突破现有方法局限,在主流数据集上超越SOTA。
Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA
Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。
一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码
现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。
30人团队震撼英伟达!Jim Fan自曝三个教训,重押世界模型
英伟达Jim Fan带队创立GEAR实验室,30人团队产出惊人,涵盖机器人学习完整技术栈。团队有GR00T基础模型等成果,Jim Fan还分享三个教训,重注视频世界模型,提出仿真世界三阶段,指出物理AI未来是新基础设施。
生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架
港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。
LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代
Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。
阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent
8月3日,阿里巴巴发布新一代基座大模型Qwen3.8,总参数量2.4万亿,性能居全球第一梯队。其API已上线千问AI平台,还接入“千问办公”。Qwen3.8编程和办公能力强,还将开源,性价比高。
40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画
ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。