「视觉token」共找到 1235 篇相关文章
微软叫停Tokenmaxxing!预算卡死,超限自负
从今年7月起,微软为各业务部门设「AI Token预算目标」,将GPT - 5.6设为内部默认模型。此前Tokenmaxxing风靡硅谷,如今大厂纷纷收紧AI使用,微软是最后跟进者之一。
AI 行业最被低估的武器,是审美
AI竞赛激烈但产品趋同,品牌价值愈发重要。文章从品牌视角切入,阐述AI产品美学的三点基础洞察,梳理14个视觉标识趋势,还将品牌归为五类原型,强调品牌建设的重要性。
上线120小时,Moltbook全球瘫痪!150万AI服务器已炸?
火遍全球的Moltbook上线120小时就瘫痪,服务器账单高得离谱。刚被扒皮150万AI多数是人类假扮,其还存在大量安全漏洞,OpenClaw耗token严重且接管电脑危险大。
Vibe Coding两年盘点:Windsurf已死、Cursor估值百亿,AI Coding的下一步怎么走?
文章回顾2023年初到2025年中AI Coding发展,涉及Cursor、Codeium等产品轨迹。指出极端‘坏用户’使商业模式崩塌,需平衡‘交付质量’与‘token成本’,还提及‘Knowledge Suggestion’功能及目标用户选择。
语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。
去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理
上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。
如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程
丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。
开发边界消失是必然,但 AI 没有替代开发者!对话 Google 全球开发者生态总监 David McLaughlin
文章是对 Google 全球开发者生态总监 David McLaughlin 的访谈。谈到 AI 会让开发边界消失,开发者应转变思维,AI 增强而非替代开发者,还探讨了谷歌工具策略、开发者出海问题、Token 管理等。