「模型突破」共找到 8209 篇相关文章
ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式
本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。
OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了
OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。
请回答2026:38位中国AI关键人物的Magic Moment和趋势判断|甲子光年
甲子光年与38位中国AI关键人物对话,总结2025年Magic Moment,展望2026年技术趋势。2025年是中国AI关键年,2026年大家不再聚焦大模型,更关注多模态、智能体等‘系统级智能’突破。
Gemini 3来了,Software 3.0也快了
作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。
NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临
传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。
ACL首届博士论文奖公布,华人学者李曼玲获荣誉提名
自然语言处理顶会 ACL 公布首届计算语言学博士论文奖,获奖者是华盛顿大学的 Sewon Min,其论文聚焦大型语言模型数据使用。此外,还有三篇论文获提名,包括李曼玲等学者的成果。
MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!
MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。
马斯克版微信亮相:支持中文,加密聊天,还专门防截屏
马斯克版微信XChat将于4月17日上线,支持中文版。其核心主打加密聊天,功能有文字、图片等发送及视频通话,还内置Grok模型。不过网友质疑其难成功,因X已有聊天功能,且微信生态难撼动,市场竞争大。
8K Star!给所有 AI 编程工具加个智能调度中心,节省 20-40% Token!
AI编程圈火了个工具9Router,它是智能调度中心,能连接主流编程工具,自动路由到40多家AI提供商和100多个模型,自带RTK Token节省器,还有实用的三级降级机制,安装配置简单。
无限长、零掉帧!StableAvatar口型同步全新技术
当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。