「视觉Tokenizer」共找到 1242 篇相关文章
英伟达MIT出手!华人团队重磅开源,大模型推理内存暴降10倍
英伟达、MIT、浙大华人研究者联合推出TriAttention,核心是在pre - RoPE空间用Q/K三角集中度估计KV token重要性,保留关键部分。它使内存消耗降10倍,吞吐量提2.5倍,还提供vLLM集成和MLX实验性支持。
跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了
Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。
从拒绝AI到一切先问Agent,DHH:这是我最爽的编程时刻之一,但程序员黄金时代到头了
Ruby on Rails 作者 DHH 从拒绝 AI 到拥抱 Agent-First 编程工作流。他认为 Rails 因 token 效率或复兴,设计能力成核心竞争力,资深工程师更易从 AI 获益,程序员黄金时代或到头。他分享了使用 Agent 的体验和对行业的看法。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
ICLR 2026|首个微观世界模型MicroVerse来了,AI开始模拟看不见的世界
过去两年,世界模型成为大模型演进重要方向,但现有模型多聚焦宏观世界。本文提出MicroVerse模拟框架,将研究边界拓展到微观尺度,还推出MicroWorldBench评测基准和MicroSim - 10K数据集,推动AI从视觉模拟迈向科学模拟。
老黄入局吃龙虾!英伟达发布最强开源Agent推理模型
英伟达发布并开源120B参数的MoE模型Nemotron 3 Super,在多项测试中表现出色。它原生支持100万token上下文,吞吐量大幅提升。英伟达还计划五年投260亿美元构建开源AI模型,开放全参数权重等。
Claude 开始收“代码审核税”:一条 PR 25 美元,大厂一年或花百万,还得上交整个代码库
3月9日,Anthropic推出代码审查产品Code Review,运行在GitHub和CI流程,按token计费,每次15 - 25美元,速度约20分钟/次,用整个代码库分析。虽能发现问题,但价格贵、速度慢,还遭“既当运动员又当裁判”质疑。
互联网已死,Agent 永生
文章指出互联网时代诸多概念如DAU、SaaS等已过时,因旧前提‘人是软件用户’改变,新前提是‘Agent是软件新主人’。还阐述Agent时代四块基石,如Token是特权、Agent是人口红利等,强调新旧世界差异大。
前端同事看走眼了,这个“游戏网页”其实全是AI写的!
Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。