多模态语言推理」共找到 3455 篇相关文章

开源动态7

4.5k星星爆火!用图片压缩Fable 5上下文,成本大幅降低,终于用得起这个模型了

Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。

开源AI项目落地
开源动态7

在一台1970年代的PDP-11上训练Transformer需要多久?答案是5.5分钟

近日,开发者复现1970年代技术环境,用PDP - 11汇编语言实现Transformer并训练成功,项目叫ATTN - 11。在低资源下实现功能闭环引热议,大家思考Transformer到底需要什么。

机器之心
新闻资讯7

扒一扒Meta全新大模型Muse Spark里藏着的PDR技术

Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。

PaperAgent
开源动态8

阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!

阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。

开源星探
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。

AI科技评论
算法论文8

DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透

DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。

量子位
新闻资讯8

一百万亿Token里的AI现状:OpenRouter和a16z重磅研究带你透视AI江湖

OpenRouter和a16z发布重磅研究,用100万亿Token绘制AI实景地图。2025年推理模型崛起,开源模型流量份额攀升,编程与角色扮演需求大,还揭示了用户留存的“灰姑娘效应”等,展现多元AI世界。

AIGC开放社区
新闻资讯8

智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式

2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。

AI前线
算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
算法论文8

绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%

JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。

深度学习自然语言处理