多语言处理」共找到 5417 篇相关文章

算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
7

安卓彻底变了!Gemini接管所有屏幕,苹果连影子都没追上

谷歌在 Android Show I/O Edition 宣布,Android 从「操作系统」转型为「智能系统」,Gemini Intelligence 植入安卓设备,覆盖硬件,还推出 Googlebook。谷歌端侧铺 Gemini,云端投 Claude,与苹果策略形成对照,竞争关键在分发。

新智元
新闻资讯7

创新中心| AI视觉创意不再拼“出图快”,而是拼“人味浓”?

北京AIGC视听产业创新中心位于朝阳区,是推动影视制作基地建设的举措。由方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家伙伴。首创郎园拓展能力,项目延伸地。

郎园Station
新闻资讯8

一文带你通俗易懂的看懂"人工智能+",这是十年一遇的大机遇。

作者解读《关于深入实施“人工智能+”行动的意见》,对比‘互联网+’指出‘人工智能+’核心是‘赋能’,还阐述其在领域的应用及影响,最后提醒大家面对挑战抓住机遇。

数字生命卡兹克
产品应用8

松下发布模态大模型,文本、图像、音频随意切换

模态数据处理成热点,但现有模型处理复杂任务有挑战。松下开发模态大模型OmniFlow,采用模块化设计、模态引导机制,实验显示其在任务中有卓越表现。

AIGC开放社区
开源动态8

21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!

FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。

开源星探
产品应用7

Anthropic 官方:Genspark 是如何构建 Agents 的?

Genspark借助Claude打造自适应AI Agents,突破传统搜索工作流限制。其Super Agent以Claude为核心,实现动态协调,变革用户创造和研究方式,带来显著商业影响,揭示AI开发新原则。

特工宇宙
算法论文8

用3D几何先验驱动视频扩散,实现更一致的世界生成

视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在基准测试表现领先。

机器之心
开源动态8

8.9K Star!号称 Notebook LM 开源平替,支持 16+AI 模型,一键部署!

Google Notebook LM 虽方便,但有数据泄露风险且被平台绑定。开源工具 `open-notebook` 是其平替,支持 16 + 家 AI 模型提供商,可处理模态内容,能本地部署保障数据安全,还具备种实用功能。

开源先锋
推荐文章7

王云鹤眼中的Harness:复杂优化问题,AGI灵魂争夺之战

王云鹤在知乎文章中探讨Harness Engineering,指出Agent=Model+Harness,模型配合能提升Agent能力。还分析Harness存在的必要性,认为它是复杂优化问题,关乎AI“灵魂”之争。

机器之心