「Token调用量」共找到 1509 篇相关文章
iPhone本地跑Gemma 4火了,0 token时代还有多远?
谷歌开源新模型Gemma 4,部分小型号可在手机端本地运行,速度惊人,还有128k上下文窗口。但在处理复杂任务时表现欠佳。未来端侧模型有望蚕食云端高频简单任务,将冲击现有AI商业模式。
重磅!iPhone 端侧可部署 Gemma 4 了!完全零token消耗!
PhoneClaw 是运行在 iPhone 的本地 AI Agent,可离线运行 Google Gemma 4。它支持多模态,有隐私保障和灵活模型管理。文中介绍使用方法、自定义 Skill 方式、常见问题,还提及后续扩展计划。
聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?
本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。
钉钉DeepResearch, 0.008元/1k Token击穿地板价
阿里为7.5亿钉钉用户推出Dingtalk - DeepResearch,解决企业办公AI化痛点。系统采用“三横一纵”架构,有多阶段强化学习等三种解法及DingAutoEvaluator纵向飞轮,实现模型自进化、自纠错。
Anthropic发布AI原生创业秘籍:手把手教你怎么烧Token创业
Anthropic发布36页AI原生初创企业操作手册,将创业精准拆解为四阶段,剖析如何用Claude Code构建商业护城河。介绍各阶段任务、退出条件、常遇问题及应对策略,强调创始人判断能力重要性。
不拼GPU!中兴扔出AI超节点,把token价格打下来
在万亿级大模型时代,传统‘芯片堆砌’方式面临通信开销剧增等痛点。中兴通讯推出超节点技术,从系统级协同架构出发,通过六大维度创新,绕开单GPU芯片瓶颈,重构AI算力基础设施,推动行业向开放、融合发展。
Context Mode:为你的AI开发工具节省98%的上下文token
开发者分享开源项目Context Mode,它在Claude Code和工具输出间加中间层,采用沙箱隔离和精准检索策略,能节省98%上下文空间,与Cloudflare Code Mode互补,可提升AI从业者工作效率。
Hugging Face开源AI Sheets:零代码调用千种模型,数据处理超简便!
Hugging Face团队开源AI Sheets,这是无代码工具,有类似Excel界面,集成数千开源模型处理数据,支持批量处理、模型比较等,支持本地和在线部署,在多方面优于同类工具。
拥抱 AGI 时代的中间层⼒量:AI 中间件的机遇与挑战
文章指出大模型发展呈能力跃迁、生态开放趋势,推动AI应用从聊天机器人向组织级智能体演进。AI中间件可解决应用工程化挑战,但面临上下文管理、记忆更新等难题,短期助力应用规模化,长期或成组织智能“神经中枢”。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。