大语言模型推理」共找到 8238 篇相关文章

新闻资讯8

英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的

9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型到n - gram查表法等方案,还提到硬件常数对模型架构的约束。

新智元
开源动态8

85倍速度碾压:苹果开源FastVLM,能在iphone直接运行的视觉语言模型

苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它速度快,首个 token 输出速度较同类模型提升 85 倍,还兼容主流 LLM,适合边缘设备等场景。

机器之心
产品应用7

谷歌IMO金牌模型可以用了!推理性能秒了o3、Grok 4

谷歌拿下IMO金牌的模型Gemini 2.5 Deep Think已在Gemini App推出,速度更快、实用性更强。该模型仅对Ultra订阅用户开放,月费约1803元。其推理性能超o3、Grok 4,有迭代开发等优势。

量子位
开源动态8

推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源

DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。

量子位
算法论文8

当 AI 下场炒 A 股,「推理」成了新的直觉

海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。

AI科技评论
开源动态8

让OpenAI只领先5天,百川发布推理模型,掀翻医疗垂域开源天花板

百川智能发布医疗推理模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。

量子位
产品应用8

字节发了个机器人全能大模型,带队人李航

字节推出Seed,其Robix视觉—语言模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位
推荐文章7

本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型

文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。

新智元
开源动态8

一个模型超了DeepSeek R1、V3,参数671B,成本不到350万美元

Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最大 671B MoE 模型性能超 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。

机器之心
新闻资讯7

Token售卖已无溢价、大模型公司转型“系统商”?记忆张量 CTO 李志宇:智能体能力会拉开差距,长期记忆与状态管理成竞争核心

InfoQ 采访记忆张量 CTO 李志宇,他指出 Scaling up 经济效益下降,大模型公司正变系统公司,核心是长期记忆与状态管理能力。2026 年若模型无代际差,价格战或加剧。智能体是主赛道,但现有模型推理能力不足。

InfoQ