「多模态语言推理」共找到 3446 篇相关文章
基于LLM的Agentic Reasoning框架综述:从方面到场景的全面总结
近年来,大型语言模型虽能力强但有局限,研究者构建基于LLM的智能体系统。此综述论文提出系统、统一分类法梳理智能体推理框架,建立统一描述语言和通用算法,分析其在不同场景表现与评估方法。
GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元
全网AI交白卷的ProgramBench编程基准,被GPT-5.5首破。它能0源码盲写程序,同一题用C和Python两种解法通过测试。相比之下,Opus 4.7表现不佳。这揭示推理算力成编程AI核心变量。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
RLPT:腾讯混元在预训练数据上实现自主强化学习
腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。
开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜
继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
一夜之间,Claude Code删掉了80%系统提示词
本周五,Anthropic 技术团队成员 Thariq Shihipar 介绍新一代大语言模型工程趋势变化。Anthropic 发现旧提示词工程范式在新一代强推理模型发布后或过时,新的 Claude.md 应精简,大砍系统提示词后可把特定任务上下文交给 Skill。
Qwen3.8-Flash:全新架构,更强更稳更划算
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
告别盲目卷参数!科大讯飞1024亮出底牌:all in“更懂你”
在模型能力趋同当下,科大讯飞在1024开发者节提出让AI“更懂你”。展示多模态超拟人“小飞老师”和「百变声音复刻」功能,发布星火X1.5大模型,还推出多领域软硬件产品,赋能多行业。
全模态RAG突破文本局限,港大构建跨模态一体化系统
香港大学黄超教授团队开源多模态智能处理系统RAG - Anything,突破传统RAG技术单一文本局限,整合多模态文档解析等核心能力,解决现有RAG系统痛点,具备多方面技术亮点,有便捷部署方式和多场景应用模式。