「token危机」共找到 759 篇相关文章
刚刚,高盛发布26页深度 AI 报告:谁将为GPU的饥渴买单?
高盛发布26页《Powering the AI Era》报告指出,AI服务器农场吸电速度远超电网扩容,引发电力危机。报告分析电力供应来源、应对策略等,还提到数据中心供需缺口扩大,电力成AI最大瓶颈,中国公司或因电力等优势成劲敌。
OpenAI重回巅峰:GPT‑5.5全球SOTA,碾压Opus 4.7
OpenAI发布GPT - 5.5,定位为‘为真实工作而生的新一代智能’。它在编码、科研、办公等多领域表现出色,能力重心转向‘自主完成任务’,在多项评估中成绩优异,还能加速生物医学研究,且Token效率大幅提升。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
现在3行配置就能让GPT - 5.6 Sol封印解除,在Codex里用上1M上下文。不过有网友警告轻易别用,因超出默认窗口,模型消耗token速度会翻倍,且模型上下文利用能力会下降。此外,Codex确定会上Astra。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
13 年苦熬到 170 亿市值,一夜间被用户抛弃!一封“AI吹”全员信让网友“不喷不行”
Duolingo是热门教育应用,市值达170亿美元。CEO宣扬“AI优先”,引发网友不满,大量用户抗议。Duolingo早期靠志愿者产出高质量内容,后用AI生成,在小语种上问题频发,公司还试图用搞笑视频化解危机。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
相信大模型成本会下降,才是业内最大的幻觉
很多AI创业者认为模型降价能降成本、改善营收。但文章指出,成本下降仅针对老旧模型,最好模型成本大致相同,且模型token消耗激增。还探讨了AI创业商业模式,如按使用量计费、建立高切换成本、垂直整合等。
OpenAI资金链告急!紧急启动300亿美金融资,星际之门现在岌岌可危
OpenAI为“星际之门”项目寻求300亿美元融资,该项目由其和软银牵头,总投资可达5000亿美元。但OpenAI与软银在选址和规模上起冲突,软银要求其重组,否则削减投资。OpenAI未盈利,内外危机重重。