「多尺度生成」共找到 5668 篇相关文章
缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈
现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。
Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型
上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。
Anthropic 技术栈里的「五宗罪」由何而来?
Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、长上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。
投资人们都在看!「甲子引力X2025科技产业投资大会」都透露了哪些新机会? | 甲子引力X
8月21日,「渡口——甲子引力X2025科技产业投资大会」在北京举行。甲子光年创始人张一甲发布报告,总结市场趋势与投资逻辑。多位投资人参与巅峰对话、圆桌讨论,分享见解,大会还发布多个投资榜单。
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
长期以来,机器人系统多依赖专有模型,场景变化时需重新训练。如今具身智能步入下半场,它石智航通用具身大模型AWE3.7用同一颗“具身大脑”贯通多场景,回应了通用泛化命题。
Meta再推WorldGen,简单一句话,竟「盖」出50×50米一座城
Meta推出WorldGen,可根据文本提示生成可探索的3D世界。它融合多项技术,能生成50×50米完整纹理化场景,保持风格与几何一致。虽处于研究阶段,但成果可兼容主流游戏引擎,有降本增效潜力。
画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026
当下视觉生成中,开源模型在逻辑推理生成任务上频频翻车,与闭源模型有差距。浙大与阿里团队提出Unified Thinker,将思考与执行解耦,构建数据集、采用创新算法,实验显示其有效提升逻辑执行准确度。
最新视觉大模型 DINOv3论文精读(逐段解析)
DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。
腾讯的这款AI数据智能体工具Lumos,颠覆了传统的数据分析
文章聚焦腾讯AI数据智能体工具Lumos,它是Tomoro的数据智能体,采用多智能体架构解决复杂问题。文中介绍其技术思路、实践方案,如解决多智能体一致性、提升查询响应等,还提及后续优化方向。
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。