「AI Token」共找到 10107 篇相关文章
阿里云 Tair 基于 3FS 工程化落地 KVCache:企业级部署、高可用运维与性能调优实践
本文介绍阿里云 Tair KVCache 团队与服务器研发存储软硬件结合团队对 3FS 的工程化升级实践。从性能、产品、运维维度优化,为高性能 KVCache 在企业级 AI 场景落地提供范式,还提及未来 3FS 产品化及服务器硬件升级方向。
飞轮“倒转”,灵巧手厂商困在夹缝里
2024年具身智能焦点转向灵巧手,初创公司遭上下游夹击。技术远未成熟价格战却已升级,投资者押注最AI、最像人手、最早量产。但智能不足、应用场景不明确,降本成唯一共识,行业陷入“降本缺规模”死循环。
曝GPT-5.5用上「全球最快芯片」,Claude慌了!
新智元报道,OpenAI的GPT - 5.3 - Codex - Spark用Cerebras的WSE - 3芯片达2000 token/秒。Cerebras CFO称在跑GPT - 5.4和GPT - 5.5,但SemiAnalysis报告指出其跑大模型有短板,且公开云模型小、上下文短。
手握30亿、被蚂蚁狂挖人,转型被骂惨的王小川,真的翻身了?
在大模型竞争中,2023 年成立的百川战略收缩聚焦医疗,起初内外存疑。2025 年,AI 医疗技术与应用进展显著,今年初大厂入局。百川如今开源 Baichuan - M3 模型,王小川认为医疗已入应用阶段、多模态非主战场,且国内 To C 更好。
RAG新SOTA,还在5亿条数据上跑进秒级,只有它了
本文围绕RAG技术展开,指出传统RAG在多跳推理等方面存在局限。介绍了GraphRAG、HippoRAG 2的优缺点,重点阐述Zleap AI的SAG方案,它用超边结构重构数据底座,在多跳问答测试中表现出色,还能在大规模数据下低延迟落地。
当Sora2遇上国产 Vidu Q2,国产参考生真的更香了!一手亲测
国庆假期Sora 2吸睛,其客串功能将它拉到“AI版抖音”高度。但Vidu去年9月就提出【参考生】视频功能,Vidu Q2已是第5个迭代版本。文章对Vidu Q2参考生视频和Sora 2从一致性、物理规律遵循、运镜等维度进行PK。
马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分
xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。
澜起科技:高速互连芯片巨头历史
文章讲述澜起科技发展历程。它从电视机顶盒芯片转型内存接口、高速互连芯片,虽历经政策冲击、做空危机、供应链压力与客户竞争等挑战,但凭借技术实力和研发投入,在行业中站稳脚跟,未来有望受益于AI算力需求升级。
Qwen3.8-Flash:全新架构,更强更稳更划算
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
突发!Fable 5.1遭黑客破解,27万字提示词泄露
Fable 5.1和Mythos 5.1发布,Fable 5.1推理成本低32%。但发布几小时后被破解,27万字提示词泄露,曝光了其安全限制、隐私保护等秘密。它工具增加,还破解密码、能完成多种任务,不过也有用户抱怨耗token等问题。