推理多模态」共找到 2723 篇相关文章

产品应用8

Sora爆火之际,这家AI公司的DAU正以每月翻倍速度狂奔——Agnes

OpenAI的Sora爆火,而AI Agent产品Agnes正走不同路线。它三个月内全球注册用户破百万,DAU逼近10万,ARR达780万美元且近乎每月翻倍。其多模态社区预计10月上线,追求“Vibe Lifestyle”理念。

花叔
开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
产品应用7

本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案

这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。

GitHubStore
新闻资讯7

Claude Opus 4.1被曝即将发布!Anthropic靠两大客户API收入超OpenAI

Claude Opus 4.1被曝正在内部测试,或重点提高推理和规划能力。Anthropic过去7个月ARR涨至50亿美元,API收入超OpenAI。但它收入依赖AI编程,面临GPT - 5、Grok等竞争。

量子位
算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
开源动态7

4.5k星星爆火!用图片压缩Fable 5上下文,成本大幅降低,终于用得起这个模型了

Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。

开源AI项目落地
新闻资讯7

扒一扒Meta全新大模型Muse Spark里藏着的PDR技术

Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。

PaperAgent
开源动态8

阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!

阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。

开源星探
算法论文8

DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透

DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。

量子位
新闻资讯8

一百万亿Token里的AI现状:OpenRouter和a16z重磅研究带你透视AI江湖

OpenRouter和a16z发布重磅研究,用100万亿Token绘制AI实景地图。2025年推理模型崛起,开源模型流量份额攀升,编程与角色扮演需求大,还揭示了用户留存的“灰姑娘效应”等,展现多元AI世界。

AIGC开放社区