视觉设计」共找到 1881 篇相关文章

算法论文7

Thinking Machines再发文:模块化流形让训练更稳定

Mira Murati团队分享神经网络训练推理新研究,提出“模块化流形”让训练更稳定。将权重约束在Stiefel流形,设计Manifold Muon优化器,实验显示效果好,但计算开销和理论问题待解决,代码已开源。

AI工程化
算法论文8

Sora没做到的,LongVie框架给解决了,超长视频生成SOTA

视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。

机器之心
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
算法论文8

ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题

文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。

机器之心
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
开源动态7

第六章 Coding优先编的是「过程与约束」,不是「参数」

本章以开面包店类比训练大模型,介绍 AutoResearch 自主实验框架。它将研究生助理工作循环交给 Agent,在固定时间用单一指标判断好坏。仓库获约 64.7K Stars,Karpathy 设计哲学为极简主义与固定约束。

CourseAI
新闻资讯7

OpenSandbox:重新思考 Agent 时代的 Runtime|QCon 北京

4月16 - 18日QCon全球软件开发大会将在北京举办,聚焦Agentic AI时代软件工程重塑。阿里陶宇田将分享《OpenSandbox:重新思考Agent时代的Runtime》,结合阿里实践解析关键设计与经验,大会还有20多个专题论坛。

InfoQ
推荐文章7

Harness Engineering又他妈是啥?

AI圈新词Harness Engineering引发关注。它类似给AI套缰绳,让其运转更高效。通过案例表明,模型非瓶颈,环境才关键。还介绍不同实现方式,指出命名有价值,最后探讨培养新人设计harness的问题。

花叔
新闻资讯7

OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark

OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。

AI寒武纪
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位