「非推理模型」共找到 8468 篇相关文章
大佬深度解析:Coding Agent的底层运行逻辑是什么?
本文由AI领域知名学者Sebastian Raschka撰写,探讨编码智能体及其编排的设计、工作原理和组件协同。指出智能体周边支撑系统重要性不亚于模型本身,详细阐述编码智能体六大核心构建模块。
最强开源搜索再升级,研究、预测能力实测超惊艳!
MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。
DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!
昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。
入局AI Infra:程序员必须了解的AI系统设计与挑战知识
文章分享传统后台工程师技术栈和方法论如何迁移到AI系统,系统性拆解AI Infra的硬件、软件、训练和推理挑战,如硬件从CPU到GPU、软件依赖深度学习框架,还分析训练和推理面临的问题及解决办法。
万字对谈 Physical Intelligence(π):具身智能的卡点和下一步突破,到底在哪?
本文是对Physical Intelligence联创兼CEO和核心研究科学家的访谈。他们探讨具身智能现状,指出当前瓶颈是智能软件,还谈到VLM性能、数据收集、模型训练等问题,认为通用机器人基础模型被低估。
刚刚,OpenAI前CTO:战胜LLM不确定性的方法找到了!
OpenAI前CTO创立的Thinking Machines Lab发布研究《战胜LLM推理中的不确定性》。研究指出LLM推理不确定性主因是批处理大小变化,而非常见认为的GPU并行性等。还给出实现批处理不变性的方案及实验结果。
震惊!如果AI掌控核按钮,95%的情况它会按下去
伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模型模拟核危机博弈。不同时间框架下模型表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。
秋招超强助攻:零基础1小时上手GPT微调!全流程教程免费开源
新一年秋招季,岗位对AI能力要求提升。OpenAI发布新开源大模型GPT - OSS,博主Lorentz Yeung开源本地部署和微调训练GPT - OSS的教程,助零基础者上手,还介绍环境搭建、代码和训练前后效果对比。
AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品
蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。