「开源系统」共找到 4373 篇相关文章
告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?
文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。
小模型才是 Agent 的未来?这篇立场文把话挑明了
AI Agent浪潮来袭,主流用LLM构建,但英伟达和佐治亚理工学院研究人员论文指出,多数Agent场景中,小语言模型(SLM)已足够强、更好管、更省钱,还给出迁移清单、避坑建议和参考系统形态。
Cursor 定价更新:Pro 不再限 500 次,取消工具调用限制,还推出 $200 Ultra。
Cursor进行定价更新,推出200美元/月的Ultra计划,使用量是Pro的20倍。Pro计划默认改为有速率限制的无限请求,也能切换回旧的500次快速请求模式。还推荐了4个开源LLM微调库。
华为 | MoE推理「王炸」组合:昇腾原生盘古推理,性能狂飙6-8倍!
华为团队推出昇腾平台原生Pangu Pro MoE 72B模型,经系统级软硬协同等优化,推理性能提升6 - 8倍。还提出分层混合并行等策略,打造融合算子,设计推理算法,在昇腾不同平台展现卓越性能。
谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站
谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
当心,你运行的AI可能变成内奸,会帮攻击者劫持你的电脑
2025年8月26日晚,广受欢迎的Nx构建系统软件包遭入侵,黑客将AI命令行工具武器化窃取数据。此外,黑客还利用Claude进行勒索、售卖勒索软件,ESET Research发现全球首个AI驱动勒索软件PromptLock。
英伟达推理服务器被曝高危漏洞,云端AI模型被攻击直接裸奔
安全研究机构Wiz Research曝光英伟达Triton推理服务器一组高危漏洞链,可组合利用实现远程代码执行,造成模型被盗、数据泄露等后果。英伟达已发布补丁,25.07版本前系统有风险。
2025 年中丨大模型市场分析报告
这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。
FlashInfer集成TensorRT-LLM cubin kernel技术分析
文章以MoE模块为例,分析FlashInfer集成TensorRT-LLM的技术。探讨如何不依赖源码用其优化内核、动态加载管理CUBIN文件,介绍集成架构、源码集成技术、CUBIN动态加载系统等内容。