「高性能内核生成」共找到 3902 篇相关文章
谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束
谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。
推翻「预测下一个token」范式!微信AI新研究:把token压缩成连续向量更具性价比
微信AI和清华团队提出新范式CALM,把token打包成连续向量,让大模型从预测下一个token转变为预测下一个向量。实验表明它能减少生成步骤,在平衡性能和计算成本时性价比更高。
TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?
文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。
阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!
阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。
谷歌Gemini Diffusion:1500 token/秒,快如闪电!
谷歌DeepMind在I/O 2025上推出实验性模型Gemini Diffusion,将扩散技术用于文本生成。它每秒能生成约1500个token,比Gemini 2.0 Flash - Lite快5倍,具备高响应速度、文本连贯性等优势。
逐个token太慢!大模型原生并行出token,CMU、英伟达新作Multiverse
卡耐基梅隆大学(CMU)和英伟达研究者提出Multiverse,这是能实现原生并行生成的新型生成模型。它解决了现有并行生成模型缺乏连贯性等问题,通过多方面协同设计构建推理模型,还开源了生态系统。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。
一个强大的知识图谱生成工具
这是基于Streamlit的应用程序,用LangChain和OpenAI的GPT模型从文本提取图谱数据并生成交互式图谱。有两种输入方式,具备可视化等特性,还给出安装、运行等指南。
阿里最新开源王炸Agent!性能全面SOTA!
阿里WebAgent更新频繁,基本一月一版。它是类似DeepResearch的通用智能体,历经WebWalker到WebWatcher多阶段演进,各阶段解决不同问题,如网页导航、自主信息搜集等,还不断优化训练数据生成与处理方式。
自动生成 AI 领域 Reddit 趋势报告
该项目可自动从Reddit AI相关社区生成双语趋势报告。具备实时监控、多社区分析等功能,有详细趋势分析。介绍了安装设置、使用方法、创建仓库、自定义配置等内容,助用户掌握AI领域发展。