「推理策略」共找到 2745 篇相关文章
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。
想成为一名合格的 AI PM,先抛弃过去那些让你成功的经验
文章指出 AI 产品经理与传统产品经理不同,AI 是会演进的系统。掌握 AI 产品策略是 PM 首要技能,从方向、差异化、设计、部署、领导力五阶段构建策略,还介绍了结构化实验方法,无策略的 PM 将被淘汰。
上交博士最新思考:仅用两个问题讲清强化学习
上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
DeepSeek|从零构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行
开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从零构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。
Qwen3-Max-Thinking:会想能干,比强更强
正式推出旗舰推理模型 Qwen3 - Max - Thinking,其在多关键维度显著提升,性能媲美顶尖模型。引入自适应工具调用和测试时扩展技术,现已上线 Qwen Chat,API 也开放,还介绍了使用方法。
OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark
OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。
DeepSeek、智谱被曝造芯,国产大模型绕开英伟达!
据路透社等爆料,DeepSeek与智谱AI正秘密自研定制化AI芯片,目标是摆脱对英伟达等的硬件依赖,构建自身算力生态。因算力账本和外部环境压力,两家公司选择研发面向推理场景的芯片。
计算机安全第一人宋晓冬,加入Meta
本周四,UC Berkeley 计算机教授宋晓冬宣布加入 Meta 超级智能实验室,任 AI 研究副总裁。她是计算机安全领域顶尖学者,其团队也一同加入。此外,AI 推理大牛 Denny Zhou 数月前也已加入 Meta。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。