「Attention性能瓶颈」共找到 2427 篇相关文章
何恺明团队重磅新作:去掉VAE,无需Tokenizer,纯Transformer预测数据比预测噪声更高效
麻省理工学院何恺明团队发布颠覆性研究,指出主流扩散生成模型未做好去噪工作,回归洁净数据预测才是高维像素生成正解。团队设计实验验证观点,提出极简架构JiT,展现优越性能与扩展能力。
Self-Evolving Agents,AI的“自我革命”
LLMs静态性成应用瓶颈,自演化智能体成破局关键。本次分享的综述围绕演化什么、何时演化、如何演化三个核心问题展开,介绍了模型、记忆等方面的演化内容、时机和方式。
OpenAI 4 名王牌研究员“叛变”,Meta 上亿美元的签约奖金终于花出去了
近日,Meta 招募 4 名前 OpenAI 研究员加入超级智能实验室。招聘背景是其 Llama 4 Behemoth 模型有性能问题。Meta 还以高额奖金挖角,且不局限于 OpenAI,还投入巨资支持 AI 项目。
AI记忆系统首获统一框架!6大操作让大模型拥有人类记忆能力
香港中文大学等团队发布AI记忆机制综述,首次构建统一框架,划分记忆类型,提出六种操作,探讨关键主题,还对比人类与AI记忆,指明未来AI记忆系统需突破瓶颈,迈向认知跃迁。
DeepSeek最新模型意外泄露~
DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。
首发!成都华微亿门级逻辑综合加固EDA工具来了
6月26日,成都华微电子科技股份有限公司济南研发中心主任王宁发布亿门级FPGA逻辑综合与安全加固综合EDA工具。该工具前端性能比肩国外,还补上市场空白,集成加固功能,有本地化服务优势。
美团又上新模型,8个Thinker齐开工,能顶个诸葛亮?
临近春节,美团 1 月 15 日更新 LongCat - Flash - Thinking - 2601 模型。它有 5600 亿参数,引入重思考模式,智能体能力提升。实测表现佳,适合特定场景,其技术改进独特,还将推出 ZigZag Attention。
OpenAI最新硬件2026年底亮相!狂挖苹果20+老将,首款神秘设备或将颠覆iPhone
OpenAI硬件野心浮出水面,收购io后从苹果挖来二十余名工程师,预计2026年底推出首款消费级设备。它还利用苹果供应链,同时在算力上投入巨资解决瓶颈问题。
28岁辍学生掌舵Meta超级AI!小扎掷千亿,与奥特曼密谋,新「王」登顶
28岁的Alexandr Wang 19岁辍学,24岁成亿万富翁,现加盟Meta负责「超级智能」部门。他接受专访谈前沿思考,如智能体经济将至、人类成管理者、数据是瓶颈等,其理念有争议。
仅凭一篇博客,他成功入职OpenAI!核心技术或用于GPT-5训练
Keller Jordan设计Muon优化器并公开研究进展,引OpenAI和xAI关注,最终加入OpenAI。Muon性能卓越,或用于GPT - 5训练,其故事暗示传统论文模式在AI领域或已落伍。