「前缀和计算」共找到 7284 篇相关文章
Qwen3-Next全新架构,32K场景MTP吞吐提升10倍
随着模型大小和上下文长度增加,为应对成本和部署挑战,Qwen3 - Next有突破性架构创新,解决上下文长度和总参数缩放问题。它采用混合注意力、超稀疏MoE等,MTP机制让其长上下文推理吞吐量比前身高10倍以上。
Gemini Flash/Lite 更新:更聪明、更快、更省钱
Gemini 2.5 Flash 和 2.5 Flash-Lite 更新,可在 Google AI Studio 和 Vertex AI 上使用。相比稳定型号,预览型号质量和速度提升,效率更高,分别减少一定比例输出令牌。两版本各有优势,如 Flash-Lite 指令遵循等能力提升,Flash 工具使用性能更好。
突发!windsurf被谷歌收购
一直传言OpenAI要收购Windsurf的交易关闭,Windsurf转投谷歌DeepMind团队。其CEO和员工将专注代理编码工作,从事Gemini项目,谷歌获部分技术非独家许可。
已经狂揽了15.2k!Cursor 的开源平替 Void 来了!
今天介绍新工具 Void,它是开源的 Cursor 和 GitHub Copilot 替代品,完全免费。拥有强大编程功能,可直连 AI 模型,基于 VS Code 开发,对其用户友好,还介绍了上手、构建等方法。
小企业专属Claude来了!一键接入全套业务流,不用写代码AI自动算账催款
Anthropic推出Claude for Small Business,是全新连接器和工作流包,可嵌入小企业常用工具。操作简便,覆盖多领域,有安全保障,还配套培训课程和线下活动。
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。
AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用
深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。
华为曝光两大黑科技!打破推理延迟魔咒,大模型从此「秒回」
华为通过FusionSpec和OptiQuant两大技术创新,对MoE模型进行推理优化。FusionSpec依托昇腾特点,将投机推理框架耗时降至1ms;OptiQuant支持灵活量化,为大模型推理提供高性价比。
6.3K star!再见了Docker Desktop,容器与 K8s 管理的终极利器,效率飙升!
和容器打交道,过去首选可能是Docker Desktop,但它有商业许可限制、资源占用高等问题。今天分享免费开源的替代品Podman Desktop,它集成多项功能,还自带Kubernetes集成,很受开发者欢迎。
NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!
继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。