「计算量降低」共找到 2037 篇相关文章
从1000通到1.5万通,百融智能的「硅基客服」真正开始「上岗」
今年7月,一家头部物流企业和大型综合类头部券商上线百融智能的AI客服,业务量和部署规模增长显著。百融智能正战略升级,以新一代AICC智能联络技术向多行业拓展,其创始人张韶峰分享了相关思考与技术优势。
芯片团队规模近3000人!小米扩张自研芯片版图
8月24日小米举行玄戒芯片技术沟通会,公布三颗自研芯片:AI旗舰SoC玄戒O3、端侧AI加速芯片玄戒O100、智驾高算力AI芯片玄戒D100。小米重启大芯片研发五年多,投入超210亿,芯片团队近3000人。
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。
00后下场整顿Agent:啥都不学就能用好AI,这才是正确打开方式
AI圈模型变强但使用门槛变高,00后团队打造的胖鹅AI以低提示词为卖点,实测在生成视频、数据看板网页等方面表现出色。其核心是SOP体系,让AI适应人的习惯,降低使用门槛。
不换GPU,性能飙升2.8倍!英伟达用软件暴打摩尔定律
2026年1月8日,英伟达官网披露,基于Blackwell架构的推理软件栈升级,让混合专家模型(MoE)推理效率迎「阶跃式」突破,单GPU吞吐飙升2.8倍,显著降低推理成本。其通过软件针对性升级发挥硬件潜力,还进行多项优化。
智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!
Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。
小米神操作!认领榜一神秘模型Hunter Alpha,龙虾之父都忍不住打听
小米官宣MiMo-V2家族三款新模型Pro、Omni和TTS,其中Pro就是此前占领OpenRouter调用量榜单第一的神秘模型Hunter Alpha。它参数规模万亿,性能亮眼,Omni和TTS也实力强悍,此前身份引发全球网友好奇。
微信AI绝密计划曝光!但一个前腾讯员工,已经在硅谷做出来了
腾讯正为微信秘密开发AI智能体项目,计划2026年年中灰度测试,三季度全量上线。而前腾讯工程师已在硅谷做出全球首个人类与AI共生社交网络Teamily AI,能让Agent进群协作,有三层架构支撑。
Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25
Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。
GPU-MODE Leaderboards之nvfp4_gemv代码阅读
文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。