「推理部署」共找到 2645 篇相关文章
刚刚,Anthropic新作:大模型意识被发现了
Anthropic 最新研究发现 LLM 有可被语言化报告的全局工作空间(J - space),用 Jacobian Lens 技术能读出模型思考概念、干预推理,还可暴露其未说出口的意图,为 AI 安全审计提供新途径。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
拆解大模型几项核心操作背后的数学与 Infra 优化逻辑
文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
AI 驱动的数据库心脏:如何让云原生「自我进化」
本文深度解析腾讯云自研云原生数据库 TDSQL - C,它融合 Serverless、AI 技术,解决传统数据库痛点。具备存算分离、智能伸缩、AI 预测等特性,能降本增效,还可全球部署,为企业数字化出海提供数据基座。
性能碾压GPT-4.1-mini!Mistral开源Devstral,还能在笔记本上跑
法国AI初创公司Mistral与All Hands AI合作,发布全新开源语言模型Devstral,有240亿参数,所需算力低,可本地部署。它能解决真实GitHub问题,在SWE基准测试中表现优于多个模型,还能通过API访问。
刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃
深夜谷歌推出Gemini 3.8,六周内第三款Flash系列模型。含通用的Gemini 3.8 Flash和网络安全专用的Gemini 3.8 Flash Cyber,提升推理、代码能力,在多场景表现出色。已面向不同群体开放。
为训推加速!全新FlashQLA注意力算子库开源
自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。
谷歌最新发表的Science论文,颠覆了人类对ASI的想象
谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。
1美金时薪雇个全栈替身,MiniMax M2.5让打工人也能体验当老板的感觉
春节档模型大战,MiniMax官宣新模型M2.5,主打智能体和Vibe Coding,性能比肩Claude Opus 4.6。它全栈能力强,能处理长链路任务,推理吞吐量高、成本低,已接管MiniMax 30%真实业务。