「Seed 2.1 Pro」共找到 3538 篇相关文章
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!
FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。
超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。
当中国AI喊出「开源脑机」,马斯克站到全网的对立面
中国AI「论论全球」直播呼吁开源脑机接口,引发海外热议,将马斯克旗下闭源的Neuralink推上风口浪尖。它指出脑机接口安全风险大,窗口期只剩1 - 3年,还提出开源科技文明构想。
谷歌开放世界模型一夜刷屏,AI游戏门槛归零时刻来了?
谷歌DeepMind开放世界模型Genie 3的实验性研究原型「Project Genie」,由Genie 3、Nano Banana Pro和Gemini提供技术支撑,有世界草绘、探索、重混三大玩法,但Genie 3仍处早期需改进。
美国视频生成老炮儿,入局世界模型
Runway发布首个通用世界模型GWM - 1及一系列变体,包括GWM Worlds、GWM Avatars、GWM Robotics,均基于Gen - 4.5构建。还对Gen - 4.5升级,新增原生音频生成、编辑和多镜头编辑功能。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
微软又搞大新闻:GitHub Copilot 开源,VS Code 要变天了。
微软官宣将把 GitHub Copilot Chat 扩展代码开源,重构相关组件到 VS Code 核心,使其成开源 AI 编辑器。还推出 Coding Agent,能自动化处理多种开发任务,目前在 Copilot Pro Plus 版本预览。
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。