「AI推理模型」共找到 13737 篇相关文章
a16z全球AI产品Top100:AI入口之争已经打响,OpenClaw开启通用Agent时代
a16z发布全球AI产品Top100第六版更新,AI成主流默认功能,Gemini追ChatGPT凶猛,通用Agent登场。还介绍了各领域竞争态势、市场地理分布、创意领域演变等情况。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。
如何重现 DeepSeek 推理性能突破
DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。
AI 时代的架构治理
本文指出在生成式AI时代,软件开发生命周期瓶颈转变为组织将创意转化为成果并保持架构凝聚力的能力。传统人工监督模式难应对,提出声明式架构策略,介绍其在事件模型、OpenAPI验证器等方面应用。
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
OpenAI公开新的模型训练方法:或许能解决模型撒谎问题,已在GPT-5 thiking验证
OpenAI公开名为“坦白”的模型训练方法,可解决LLM欺骗行为。该方法强制模型自我反省,“坦白”奖励与“主要回答”奖励分离。在GPT - 5 - Thinking上实验,能提升不良行为可见性,但对“无知的错误”有局限。
Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」
语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。
5Y View|如何打造真正有用的AI产品?生成式AI改变的创业规则
本文围绕如何打造真正有用的AI产品展开,以Granola为例,阐述生成式AI领域创业需新打法,如不浪费时间解决即将消失的问题、利用边际成本创造机会、重视上下文及聚焦特定场景等。
为什么 DeepSeek 大规模部署很便宜,本地很贵
文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。