「小模型推理能力」共找到 9219 篇相关文章
大模型的价格战,打到硅谷了
今年夏天,AI价格战风向改变,OpenAI酝酿降价从Anthropic抢客户。7月,Anthropic推半价平替Claude Opus 5,此前OpenAI发布GPT - 5.6打性价比。价格战因大模型购买逻辑变化、头部差距难支撑溢价等引发,虽让应用层受益,但对模型公司是资本耐力赛。
线性注意力回归!Kimi新模型引爆,MiniMax却悄悄换回传统架构
LLM领域线性注意力机制正在回归,工程实践主要由国产模型推进。早期线性注意力因牺牲精度未获主流认可,今年下半年多个国产模型采用其变体,MiniMax却又换回传统架构,Kimi新模型带来新解法。
535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。
现在,最会赚钱的AI是Qwen3!全球六大模型厮杀,Top 2来自中国
大模型「炒股」大赛中,阿里Qwen3 Max逆袭DeepSeek夺冠,成「最会赚钱」模型,GPT - 5成「最会赔钱」AI。比赛由Nof1实验室打造,Qwen3 Max成绩体现国产大模型实力。
现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了
Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
李飞飞发布Atlas,世界模型进入新时代
李飞飞创业公司 World Labs 发布新一代世界模型 Atlas,它是全模态模型,能处理四模态数据。其核心为空间上下文设计,评测成绩不错,应用场景丰富,公司发展节奏密集,产品路径有转向。
英伟达韩松团队新作:具有后神经架构搜索的高效语言模型
英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。
OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE
OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。
对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能
具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。