多模态语言推理」共找到 3468 篇相关文章

新闻资讯7

Token 新译名:「智元」

文章讨论Token新译名「智元」,认为其比「词元」更合适。介绍英伟达GTC 2026上黄仁勋强调AI推理时代智元重要性,OpenClaw消耗大量智元引争议,还提及黄仁勋闭门会观点及多位大佬对「智元」译名的认可。

新智元
开源动态8

社区供稿丨Ring-2.5-1T,思更深,行更远

今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。

Hugging Face
开源动态8

Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3

Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。

量子位
产品应用8

顶级视频模型半衰期只有 30 天,但生成式媒体 infra 公司的收入却在一年增长了 60 倍

文章聚焦生成式媒体 infra 公司 fal.ai,其借统一 API 和云端平台让开发者高效调用多模态模型。深入分析其成功因素,如早期押注生成式视频、优化算力和成本、构建生态等,还探讨用户使用模式与行业发展趋势。

Founder Park
算法论文8

小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
开源动态8

中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强图文跨模态模型

360推出FG-CLIP2图文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级看图,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。

机器之心
新闻资讯8

英伟达:RLP 让 AI 在预训练时就学会思考

英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式。

AI工程化
新闻资讯7

Murati翁荔陈丹琦公司发布首个产品,让大模型微调门槛暴降,要重新发明一个OpenAI

Thinking Machines Lab发布首个产品Thinker,让模型微调像改Python代码一样简单。它是用于微调语言模型的灵活API,降低了大模型微调门槛,受到业界关注。此外,该公司还尝试重新发明OpenAI,而OpenAI正打造社交模式。

量子位
新闻资讯7

Andrej Karpathy回应强化学习之父Sutton最新观点「LLM是“死路一条”」

图灵奖获得者、强化学习之父Richard Sutton认为当前热门的大语言模型是“死路一条”,因其缺乏从实际互动中学习的能力。AI大神Andrej Karpathy认同其批评,认为当前LLM是向现实妥协的产物,还提出了“幽灵”比喻。

AI寒武纪
开源动态8

小红书最新开源TTS力作!4人对话自然无缝,毫秒极速响应!

近年来TTS技术爆发,但多人对话的自然流畅性和长序列稳定性一直是难点。小红书团队开源的FireRedTTS - 2是面向多人对话场景的TTS模型,实现自然切换和低延迟,支持多语言,适用于多种场景。

开源星探