分层稀疏注意力」共找到 442 篇相关文章

算法论文8

ICLR2025 | LLM为什么能拒绝回答有害问题呢?

该论文首次系统性研究注意力头在LLM安全中的作用,提出Ships和Sahara方法,在极少参数改动下显著降低模型安全性,发现不同模型安全头高度重叠,为理解模型安全机制提供新视角。

深度学习自然语言处理
产品应用7

竞购 Chrome,正面竞争 OpenAI,Perplexity 为什么要做 AI 浏览器?

今年 Perplexity 推出 AI 原生浏览器 Comet,OpenAI 也计划发布浏览器,Perplexity 还出价 345 亿美元收购 Chrome。文章梳理了 Perplexity CEO 观点及 a16z 测评,介绍 Comet 特点、目标、优势,还对比了 Comet 与 Dia。

海外独角兽
新闻资讯7

996 工作制席卷硅谷!招聘启事惊现“加班警告”:接受就是年薪翻倍+股权暴增,不接受就滚蛋

996工作制正席卷硅谷,尤其在AI等领域成部分公司“成长密码”。部分初创企业公开要求员工接受996,也有公司分层推进。不过,此举引发争议,还存在法律风险,网友也对此有不同看法。

AI前线
新闻资讯7

中国光芯片迎来“迈向高端”黄金窗口期

近期光芯片领域热度攀升,政策、产业、资本利好。AI算力爆发使光芯片从‘通信管道’升级为‘战略性资源’,需求大增但供给端短板凸显。本土产业链分层,高端赛道迎来突破窗口期,有三条主流技术路线。

芯师爷
开源动态8

读完这篇,你就搞懂 DeepSeek v4 了

2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。

腾讯技术工程
算法论文8

告别死记硬背!SkillRL自动提炼Skills持续进化

大型语言模型智能体常孤立运行,难从经验学习。SKILLRL受人类技能启发,提出有效经验迁移需抽象。它通过经验驱动的技能蒸馏、分层技能库和递归技能进化机制,在多实验中表现出色。

PaperAgent
新闻资讯8

168小时AI狂写300万行代码造出浏览器!Cursor公开数百个智能体自主协作方案

Cursor创始人公布实验结果,让数百个AI智能体跑一周,从零造出可用Web浏览器,产出超300万行代码,项目源码已公开。此次实验靠GPT - 5.2 - Codex,还设计了智能体协作架构,引发业界讨论。

量子位
开源动态8

NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈

在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。

AINLPer
新闻资讯7

25000 美元卖公司内部截图,丢了饭碗还要吃牢饭!大厂百万年薪抢招“内鬼分析师”,围剿下一个“自己人”

全球顶尖网络安全公司CrowdStrike遭“内鬼”泄密,黑客以25000美元收买员工获内部截图。如今全球大厂高薪抢招“内鬼分析师”,但构建内部威胁框架不易,需分层协作的安全与文化策略。

InfoQ
开源动态7

我MiniMax,用实习生处理数据,照样屠榜开源大模型

MiniMax M2屠榜开源大模型,引发社区热议。它在注意力机制、数据处理、思考模式上另辟蹊径,公开技术细节。M2团队选Full Attention,雇实习生处理数据,提出交错式思维链策略,强调实用性和泛化能力。

量子位