「全注意力残差」共找到 2026 篇相关文章
1人1假期,肝完10年编程量!马斯克锐评:奇点来了
硅谷大佬新年收假分享编程Agent提效成果,Midjourney创始人假期编程量超过去10年,马斯克称进入奇点。多位工程师也有类似体验,Claude在编程方面表现出色,国产字节TRAE中国版SOLO全量免费开放。
摩尔线程算法一鸣惊人,图形学顶会夺银!已开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭借自研技术LiteGS在3DGS重建挑战赛中获银奖。3DGS是革命性3D场景表示与渲染技术,摩尔线程开源3DGS基础库LiteGS,实现全链路协同优化。
DeepSeek发布最新论文,5大杀手锏让大模型训练、推理暴涨
全球著名开源大模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。
OpenAI为龙虾紧急收购了一家23人公司
OpenAI前脚挖来龙虾之父,后脚收购专注AI安全与评测的初创公司Promptfoo。该公司开源评测框架流行,有30多万开发者用户。收购后将补齐OpenAI在‘龙虾安全’方面关键一环,且继续保持开源。
谷歌Gemini一次提示能耗≈看9秒电视,专家:别太信,有误导性
谷歌报告称处理一个中位数的Gemini文本提示能耗低,2024 - 2025年单个文本提示能耗降33倍、碳足迹减44倍,归功于全栈式优化。但专家质疑其方法论,指出未算间接用水、碳排放核算不全等问题。
养了只东北味熊猫当AI合伙人,一口一个老铁,还真帮我开了家「一人公司」
腾讯ima上线copilot模式,可“领养”小熊猫并设定人设风格,成专属知识伙伴。它不分对话和任务模式,知识库功能实用,还能私人定制。作者用它模拟创业,体验良好,其记忆和全场景感知实用。
AI 开发时代的“能力暴露与禁止空间”方法论:TPDD 与高层测试闭环
文章指出大模型加速软件开发范式演进,AI 深度介入开发带来新生产路径,但也放大风险。作者提出 TPDD 方法论,通过提前定义测试点与边界条件,平衡能力利用与风险控制,确保系统可控、安全、可持续。
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。
deepseek-V4算法工程技术深入浅出
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
突发!OpenAI推出首款自研AI芯片:能效暴打当前SOTA,今年底G瓦级部署
OpenAI和博通联合发布自研AI推理芯片Jalapeño,它专为大模型推理设计,每瓦性能优于当前最先进水平,九个月完成设计制造,是全栈战略一部分,2026年底开始吉瓦级部署。