「自注意力层」共找到 1538 篇相关文章
中国算力芯片的“新十年”
文章指出过去40年处理器芯片发展呈“否定之否定”,近年整机和平台厂商重归自研,异构计算成趋势。未来中国算力芯片突破口在指令系统结构统一,可把RISC - V作统一指令系统开发各类芯片。
OpenAI 首款AI浏览器发布 —— ChatGPT Atlas |附实测
OpenAI发布首款AI原生浏览器ChatGPT Atlas,自带记忆和Agent能力,有chatgpt侧边栏、光标一选就改写等功能,目前仅发布macOS版,后续将推多版本,Agent模式付费且为预览版。
Claude Skills,4000字详解 Anthropic 的思考
Anthropic推出新技能Claude Skills,作者认为它会引导第三方工具形态。Skills结合笔记式形态、可执行工具与AI调度自优化,具备低门槛、灵活表达等优势,还实现了AI自我进化,是一种新范式。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。
「逆龄大脑药」首次人体试验!奥特曼押注RTR242,返老还童将要成真?
AI教父奥特曼首投1.8亿美元给Retro Biosciences,该公司年底前将开展「逆龄大脑药」RTR242人体试验。其目标是逆转衰老,让人类多10年健康寿命,还结合GPT-4b micro辅助研发,与Altos Labs竞争。
ICLR2025 | LLM为什么能拒绝回答有害问题呢?
该论文首次系统性研究注意力头在LLM安全中的作用,提出Ships和Sahara方法,在极少参数改动下显著降低模型安全性,发现不同模型安全头高度重叠,为理解模型安全机制提供新视角。
设计师集体沸腾!阿里开源千问图像编辑模型,支持语义及外观的双重编辑!
阿里Qwen团队于2025年8月18日发布Qwen-Image-Edit模型,基于20亿参数的Qwen-Image模型,结合Qwen2.5-VL和变分自编码器,支持语义及外观双重编辑,能精准修改文字,已上线Qwen Chat等。
Figma 如何使用 AI 来支持而不是取代设计师
Figma 在设计平台集成 AI,有自动命名层等功能,能将文本提示等转换为生产就绪代码。其 AI 功能基于早期基础设施,关键在于 Dev Mode 和 MCP 服务器,确保设计师掌控输出,降低制作软件障碍。
梳理SGLang中DP Attention及其Padding问题
作者梳理SGLang中DP Attention及其Padding问题。介绍DP Attention背景、流程,指出padding分max和sum模式,旧版sum padding浪费计算、影响cuda graph使用,v0.4.10后有优化,max padding仍待完善。
The Batch: 862 | OpenAI 的重新"开放"
OpenAI 发布自 2019 年 GPT - 2 以来首个开源权重模型 gpt - oss 系列,含 gpt - oss - 120b 和 gpt - oss - 20b,为智能体应用设计,免费使用修改。介绍其输入输出、架构等,还对比了性能表现。