「混元图像2.1」共找到 3710 篇相关文章
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。
又走一个!OpenAI研究VP离职,转投Anthropic做RL研究员
OpenAI研究副总裁Max Schwarzer宣布离职,转投Anthropic做RL研究员。他曾主导o1、o3和GPT - 5系列post - training,因渴望回归一线研究而离开。OpenAI近年人才流失严重,而Anthropic虽面临与五角大楼交锋危机,但仍吸引人才。
“代码 + 编译器”要消失了?马斯克在 xAI 全员会上放话:到今年年底,AI 或将直接生成二进制
xAI 近期出现离职潮,马斯克公开 45 分钟全员大会视频回应。他表示离职是阶段适配问题,强调速度是当前唯一优先级。还公布新架构,涉及 Grok、编程、图像视频、MacroHard 四条线,并预测 AI 未来发展,如年底或直接生成二进制。
中国团队一夜封神,AI出海「全球第一」!曾靠游戏狂赚10亿美金
在大模型竞争激烈的当下,中国出海团队SeaArt(海艺)用2.5年超越Midjourney等,成全球访问量第一的AI内容创作社区。它打造AI原生内容生态,SeaVerse开启全模态时代,还靠洞察用户、游戏基因等优势制胜。
Unsloth让大模型跑在手机上!
Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。
前端裁员黑科技!PinMe把部署从运维清单划掉,DevOps团队专注业务
PinMe是「一条命令就能部署前端」的命令行工具,在GitHub获约1k Star。它能将静态站点上传到IPFS,写入ENS子域名的contenthash,通过网关访问,无需自搭服务器和配置传统DNS,适合Web3前端部署。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o
斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。
NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源
TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对长视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。