线性注意力机制」共找到 1036 篇相关文章

算法论文8

生成式推荐补上关键一环!语义ID首次实现可微分联合优化 | SIGIR'26

生成式推荐依赖语义ID,可现有语义ID常先学好再冻结,与推荐目标不一致。论文DIGER首次将可微分语义索引机制引入生成式推荐框架,让推荐损失参与语义ID学习,还设计策略解决训练问题,实验表现佳。

新智元
新闻资讯7

ICML2026 | 全新评审政策出炉!作者可选:评审是否使用AI

ICML 2026 为应对预期投稿量,提出互审数量限制和 AI 使用规定。此次引入评审类型选择机制,作者可决定评审是否用大模型,分严格禁止的政策 A 和有限制允许的政策 B,但执行或有困难。

AINLPer
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。

AI前线
开源动态8

500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式

香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。

量子位
算法论文8

小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超

浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。

量子位
产品应用8

编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10

Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。

新智元
新闻资讯8

11 年前的那张图,又火了

一张2015年关于AI的智能曲线图近日在X上刷屏,马斯克也进行了转发。该图作者Tim Urban将AI分为ANI、AGI、ASI三个层级,指出人类习惯线性思考,但AI进步是指数级的。如今AI发展加速,其能力边界不断扩张。

AGI Hunt
推荐文章8

构建分层的 Agentic RAG 系统:具备自主纠错的多模态推理

企业 AI 团队面临 RAG 系统在处理结构化与非结构化数据时的难题。本文探讨用分层多智能体编排解决“模态鸿沟”,介绍 Protocol - H 架构,阐述组件、机制、实现与集成,经基准测试验证其优势,还提及未来研究方向。

InfoQ
8

“10周的工作量,AI只用4天!”Anthropic发布会全程实录:你引以为傲的复杂工程,在模型眼里只是个玩具

Anthropic举办‘Code w/ Claude’开发者大会,指出AI模型能力呈‘指数级’增长,多数企业开发模式却停留在‘线性’阶段。大会祭出三大杀手锏,包括更强底层模型、Claude Platform代理编排能力和Claude Code桌面端。

AI科技大本营
算法论文8

EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力

论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。

深度学习自然语言处理