「三维生成框架」共找到 3512 篇相关文章
带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具
港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。
让AI学着“看菜下碟”!港中大等新框架让推理长度减少90%,准确率反增17%
香港中文大学等研究者提出TON选择性推理框架,使视觉语言模型能自主判断是否推理。该框架有两阶段训练机制,实验显示其让推理长度最多减90%,准确率还提升,有益模型部署。
机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%
星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。
斯坦福与Adobe新研究,模仿蒸馏技术轻松让200亿参数图像生成高质量大模型
斯坦福大学和Adobe研究院联手,用pi - Flow技术让200亿参数文本到图像大模型4步内生成高质量、高多样性图片。此前少步生成有质量和多样性问题,他们推出GMFlow和pi - Flow解决难题,LakonLab是其背后工程支撑。
首个接入GPT-5的视频Agent!一句话生成商业级广告大片,分镜配音字幕等全包了
AI视频生成进入Agent时代,Video Ocean是首个接入GPT - 5的视频Agent,输入提示词就能自动完成分镜、画面等生成爆款视频。它有自动化创作生态系统,操作简单,新手也能上手。
大神Karpathy都投的AI实时视频生成模型:直播都能立即转,无限时长几乎零延迟
AI初创公司Decart推出首个零延迟无限实时视频生成的AI模型MirageLSD,大神Karpathy都投资了。它能实时生成视频流,无时长限制且延迟低至40毫秒以下,还攻克了传统模型‘误差累积’难题。
斯坦福意外用AI生成超强CUDA内核,性能比人类专家优化得还要好!翻倍碾压原生PyTorch,华人主创
斯坦福团队意外发现AI生成的内核性能超人类专家优化的,在常见深度学习操作上能让性能提升近400%。其方法是生成自然语言优化思想再转化为代码,还使用多分支探索模式。
7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了
研究团队发布全球首个医疗代码生成大模型训练平台MedAgentGym,提供评估基准和训练生态,提升大模型医疗代码生成与推理能力。经其训练的Med - Copilot - 7B达GPT - 4o相当水平,解决医疗AI编程瓶颈。
给大模型「持续注入新知识」,北航CASE框架:编辑千次不失忆,额外参数不到1MB丨WWW'26
北航团队提出CASE框架解决大语言模型持续吸收新知识难题。该框架给编辑“算分”、调“关键神经元”,破解核心痛点。实验显示,1000次编辑后准确率提升近10%,额外参数不到1MB。
CJA | 中国航天气动院冯亦葳、许亮等:符号回归启发的可压缩流场结构智能识别:基于局部对流特征分布的统一理论框架
目前流场结构识别方法有局限,传统经验法依赖阈值,深度学习法可解释性与泛化能力不足。本研究从流体控制方程出发,用符号回归建立统一流场结构分类框架,能准确识别复杂流动结构。