新推理模型」共找到 9609 篇相关文章

算法论文8

测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因

Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。

PaperAgent
开源动态8

4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源

上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。

OpenMMLab
新闻资讯7

火速吃瓜,OpenAI模型还没发又惹出争议了??

GPT - 6发布前夕消息不断,OpenAI模型引入的“循环深度”技术因可能让模型思考难监控引争议,同时模型名或被API剧透,图像模型GPT Images 2.1也将更

量子位
开源动态8

杨植麟被梁文锋叫醒了!Kimi模型发布即开源,1T参数全线SOTA

172天后,Kimi推出全Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。

量子位
产品应用8

壁垒在上下文,不在模型

特赞科技发布企业级智能体系统 GEA,推出发散推理模型和企业上下文系统。指出模型能力易复制,企业上下文才是壁垒。GEA 架构分四层,有独特的推理和执行模式,已在多家企业部署。

AGI Hunt
算法论文8

冷门语言AI写不动?IEEE论文:从零到及格线,MoonBit给出完整训练路线

IEEE论文聚焦语言MoonBit和Gleam,探讨大模型代码生成能力。研究发现大模型零样本生成语言代码能力差,few - shot和RAG有提升但有限,继续预训练及指令迁移可显著提高模型表现。

量子位
算法论文8

DeepMind率先提出CoF:视频模型有自己的思维链

DeepMind在Veo 3论文中提出帧链CoF概念,类比语言模型CoT,让视频模型能时空推理。实验显示Veo 3有通用视觉理解能力,能零样本解决视觉任务,未来通用视频模型或取代专用模型

量子位
新闻资讯8

深度讨论 Gemini 3 :Google 王者回归,LLM 一轮排位赛猜想|Best Ideas

近期,OpenAI、Google、Anthropic 先后发布模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争格局,还涉及多模态、硬件、商业化及产品形态等方面。

海外独角兽
算法论文8

阿里通义发布并行计算策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。

量子位
算法论文8

超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破

文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创,在LIBERO实验中性能超经典模型,还实现推理加速。

机器之心