Tokens/s」共找到 796 篇相关文章

开源动态8

语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率

今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。

AIGC开放社区
新闻资讯7

一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”

NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。

AI前线
开源动态8

85倍速度碾压:苹果开源FastVLM,能在iphone直接运行的视觉语言模型

苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它速度快,首个 token 输出速度较同类模型提升 85 倍,还兼容主流 LLM,适合边缘设备等场景。

机器之心
新闻资讯7

开发边界消失是必然,但 AI 没有替代开发者!对话 Google 全球开发者生态总监 David McLaughlin

文章是对 Google 全球开发者生态总监 David McLaughlin 的访谈。谈到 AI 会让开发边界消失,开发者应转变思维,AI 增强而非替代开发者,还探讨了谷歌工具策略、开发者出海问题、Token 管理等。

AI科技大本营
新闻资讯7

OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark

OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。

AI寒武纪
新闻资讯7

谷歌云推出面向毫秒级延迟工作负载的 Rapid Storag

在 Google Cloud Next 2025 大会上,谷歌云推出 Rapid Storage,为频繁访问数据和延迟敏感应用提供毫秒级数据访问,有低延迟、高吞吐量等特点,还与亚马逊 S3 Express 被比较,目前处于预览阶段。

InfoQ
推荐文章8

自主Agent时代群雄逐鹿,紫东太初何以走出一条中国特色AGI之路?|甲子光年

2026年OpenClaw掀起全民AI热潮,AI进入自主Agent时代。中科紫东太初依托中科院自动化所,以自研紫东太初ScienceClaw从AI4S赛道切入,破行业痛点,走出中国特色AGI发展之路。

甲子光年
推荐文章8

Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop

Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。

AI寒武纪
产品应用8

Claude Code 的"懒加载"更新:AI 终于学会了"随叫随到"

Claude Code推出Tool Search功能,解决AI工具生态困境。它采用“懒加载”,按需调用工具,节省大量token。这反映AI工具生态从“能用就行”走向“精打细算”,对用户和开发者均有益。

宝玉AI
产品应用8

昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%

最近华为在MoE训练系统给出算子和内存优化新方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍。

新智元