「非Transformer架构」共找到 2517 篇相关文章
图像分层生成:新加坡国立大学和Lowart AI实现了图像可编辑的PSD文件输出
新加坡国立大学和Lowart AI发布OmniPSD,利用Diffusion Transformer架构解决分层图像生成与拆解难题,实现可编辑PSD文件输出。它能通过文本生成分层PSD文件,也能拆解单张平面图像,解决AI生成图像难编辑痛点。
1300亿美元,买断AGI未来?OpenAI完成5千亿股改,奥特曼0股权
OpenAI完成架构重组,非营利的OpenAI基金会手握1300亿美元股权掌控营利部门。CEO奥特曼直播分享诸多重要内容,如算力目标、研发自动化AI研究员计划等,还谈及平台战略、隐私等议题。
源神!Twitter推荐算法被马斯克悄悄开源了
马斯克将X平台(原Twitter)「为你推荐」信息流算法开源,不到一天冲到5000 Star。该算法将站内与站外内容合二为一,用基于Grok的Transformer模型统一排序,移除手工特征与大部分启发式规则。
从入门到用好 Agent Skills,看这一篇就足够了
文章是全面的 Agent Skills 中文指南,介绍其架构理念、机制、开发指南等。Claude Skills 价值被低估,它像通用 Agent 扩展包,非技术人员也能开发,还探讨了使用、开发时机与核心运行机制。
LTX-2开源:首个能同时生成视频和音频的模型
LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。
Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?
谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
Code Arena全球可用模型第一!智谱GLM-5.2上线并开源
智谱上线并开源GLM-5.2,在Code Arena等平台表现优异,长任务跑分出色,架构有突破,支持100万token上下文,还引入控制功能。模型在常用编程智能体可用,适配国产算力平台,以MIT协议开源。
训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命
英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。
默认选择 React,等于是在扼杀前端创新
文章指出默认选 React 正减缓前端创新。如今团队选前端常出于习惯而非技术契合度,使 Svelte、Solid、Qwik 等创新框架难被采用。默认选 React 还带来运行成本、架构惰性等问题,呼吁根据需求选框架。