非Transformer」共找到 848 篇相关文章

新闻资讯8

OpenClaw 带来的「线性狂飙」,代码正在成为新世界的基础设施

2026年初AI圈撕裂感十足,OpenClaw在GitHub获18.7万星标且还在涨,Claude Code等让开发者工作模式巨变,代码进化溢出,软件和代码质变,人类与代码关系倒置。

Founder Park
算法论文8

EMNLP2025 | LLM多次回答一致就一定正确吗?

随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力。

深度学习自然语言处理
算法论文8

全球首次,Transformer「混血」速度狂飙65倍!英伟达已下注

康奈尔、CMU等机构研究者提出「混合体」Eso - LM,融合自回归和离散扩散模型范式。它引入KV缓存机制,推理速度相比标准MDM提升65倍,在速度与质量平衡上超越BD3 - LM,引发AI领域关注,英伟达或押注此方向。

新智元
算法论文8

马斯克惊叹!DeepSeek和Kimi先后出手,捅破了Transformer的「潜规则」!

文章介绍了DeepSeek和Kimi在残差连接上的突破。DeepSeek让连接权重可学习,用数学约束保证稳定性;Kimi将注意力机制用于层间连接,解决了更根本的问题,性能提升显著。

花叔
推荐文章7

前 DeepMind 研究员反思:评测,而算力或数据,才是下一阶段的瓶颈

前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。

深度学习自然语言处理
新闻资讯7

一句话生成“程序员的 Claude Code 指南”,比 NotebookLM 更好用

2026年,Anthropic公司的Claude Code成热议话题。它因AI Coding火和公司能力强受关注。Anthropic CEO认为初级甚至部分高级开发工作将大多由AI完成。Claude Code不仅适合开发者,也能为普通用户提供多种功能。还能用Google Gemini图文并茂功能一句话生成其学习指南。

MacTalk
算法论文8

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
新闻资讯8

日本AI王者,CTO是Transformer之父,刚拿下世界编程竞赛冠军

在ICFP 2025编程大赛中,日本Sakana AI的「Team Unagi」以人机共创模式夺冠。其AI系统「ShinkaEvolve」优化代码,性能提升近十倍,还启发人类思维。Sakana AI以自然进化为理念,探索AI新范式。

新智元
算法论文8

无Tokenizer时代真要来了?Mamba作者再发颠覆性论文,挑战Transformer

Mamba作者之一Albert Gu参与的论文提出分层网络H - Net,用动态分块取代tokenization。Tokenization虽能压缩序列但有缺点,H - Net在多方面表现出色,或预示无需Tokenizer训练时代到来。

机器之心
新闻资讯7

刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!

谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。

新智元