多模型调度」共找到 9756 篇相关文章

开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
算法论文8

视觉思维链全新架构,加州大学让模态大模型有了灵性,整体性能提升5.3%

加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。

AIGC开放社区
产品应用8

AI 模特时代到来:字节x清华推出商用级视频换装模型DreamVVT,保真度显著领先SOTA

字节跳动智能创作团队联合清华推出视频换装模型DreamVVT,基于Diffusion Transformer构建,用两阶段设计解决复杂场景痛点,支持种输入,在保真度和时序稳定性上领先SOTA。

机器之心
算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区
产品应用7

The Batch: 916 | Gemini 强势领跑

谷歌更新旗舰 Gemini 模型,推出 Gemini 3.1 Pro Preview,以相同价格实现性能跃升。它在项基准测试中领先,性价比超对手,虽部分测试落后竞品,但提升或源于模型质量改进,成本效益策略值得关注。

DeeplearningAI
新闻资讯8

谷歌2025「复仇爽文」大结局!从至暗时刻到王者归来

2025年谷歌上演AI复仇大戏,年初被唱衰,年底凭Gemini 3等组合拳重回巅峰。在模型、开发、创意等8大领域突围,还兼顾安全责任。全年各月不断推新,涵盖系统、工具、模型方面。

新智元
推荐文章8

超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力

文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。

AIGC开放社区
新闻资讯8

刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌

2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落后5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。

机器之心
产品应用8

vivo发布端侧模态模型,只有3B可理解GUI界面,20项评测表现亮眼

vivo AI Lab发布端侧模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。

量子位