「有状态推理」共找到 7605 篇相关文章
SGLang原生支持昇腾,新模型一键拉起无需改代码
12月20日SGLang AI金融π对收官,聚焦大模型推理效率。昇腾成SGLang原生支持后端,助DeepSeek等模型免调参运行。SGLang给出推理系统工程解法,昇腾与SGLang深度共建,性能优且全面拥抱开源。
Wan 2.6 发布,可以参考视频进行角色扮演 & 终于有积分了:每天 150
Wan 2.6发布,积分从每天10个提升到150个。更新了主演、多镜头叙事、图像生成等新功能,如可将参考视频角色放入新场景,简单提示自动生成多镜头叙事视频等。
不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑大模型彻底变天
谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。
Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。
Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
斯坦福7B智能体全面超越GPT-4o,推理流登顶HF
传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
腾讯把IMA知识库开源了!WeKnora支持Agent调用、MCP协议扩展,企业级RAG零成本落地
腾讯开源WeKnora,这是面向复杂异构文档的LLM框架,走完整RAG流程。它有Agent模式,支持多种知识库类型和格式,有Web UI。适合公司、研究者、开发者等,还给出了上手步骤和部署提醒。
数学编码超越O3-high,英伟达版「DeepSeek R1二代」推理模型开源~
Nvidia开源OpenReasoning-Nemotron系列模型合集,采用Qwen2.5架构,基于500万条轨迹训练。评测输出长度最高64K token,多版本刷新SOTA。其‘heavy’模式有独特能力,32B版在数学与编程基准超越O3(High)。
只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%
南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。