「基础开发框架」共找到 3500 篇相关文章
重塑注意力机制:GTA登场,KV缓存缩减70%、计算量削减62.5%
GTA由多所高校联合研发,提出大模型框架,解决传统多头注意力机制弊端。通过分组共享注意力矩阵和压缩潜在值表示,削减计算量、缩减KV缓存,实验验证其性能优、效率高,虽有局限但前景好。
深夜开源首个万亿模型K2,压力给到OpenAI,Kimi时刻要来了?
昨晚,月之暗面发布并开源 Kimi K2 大模型,同步上线更新 API,价格 16 元/百万 token 输出。它超过多个开源和闭源模型成新 SOTA,展示出领先能力,还介绍训练关键技术,或成模型智能进化关键。
LiteReality来了!用一张扫描图还原真实3D世界
剑桥大学提出 LiteReality,可将室内 RGB - D 扫描数据转为 3D 虚拟副本,支持多种图形渲染功能,适用于多领域。它通过多步骤流程重建场景,还引入新框架解决材质恢复问题,但也存在依赖人工等局限。
刚刚!Sam Altman官宣GPT-5今夏登场:超级智能更为重要
在OpenAI官方播客节目中,Sam Altman透露GPT-5今夏或登场,还探讨AGI定义、“星际之门”算力项目、AI硬件等。如模型命名或改,算力项目解决瓶颈,重视超级智能等。
亚马逊码农噩梦来袭!沦落「仓库工人」,每天流水线分拣「AI代码」
AI工具广泛引入亚马逊编程工作,虽提升效率,但让程序员工作节奏变快,像流水线工人。亚马逊管理层推崇AI,认为能降成本提效率,可程序员担心创造力被扼杀、职业发展受影响。此外,实验显示AI编码助手能提升开发人员效率。
摩根士丹利如何攻克编程界的“最头疼问题”
金融巨头摩根士丹利开发AI工具DevGen.AI,将旧代码转现代语言,此难题通用工具难解决。该工具今年审阅900万行旧代码,节省28万小时。虽有局限,但降低对旧语言开发者依赖,且不会减少人才需求。
阿里WebDancer:训练类DeepReaserch的Agentic Model
来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。
Linear-MoE:线性注意力遇上混合专家的开源实践
近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。
Google:王者归来
Google在传统搜索与AI结合模式不明时,推出搜索AI模式。虽资本市场不看好,但巨头必须主动AI First。I/O大会发布众多成果,涵盖基础、赋能、体验层,若GPT - 5不够惊艳,2025年或成Google天下。
80亿美元押注Agent!全球第一CRM收购Informatica
昨晚,全球第一CRM平台Salesforce宣布以80亿美元全资收购Informatica,增强其数据基础,利于部署AI Agent。Salesforce高管认为二者结合能打造全面数据平台。Salesforce早布局Agent,其自研平台Agentforce应用效果显著。