视觉transformer」共找到 869 篇相关文章

新闻资讯7

谷歌Dreamer大神离职!「辛顿门徒」自曝错过Transformer

谷歌世界模型大牛Danijar Hafner宣布离任,他自2016年起在谷歌相关团队工作近十年,曾获辛顿指导,主导开发Dreamer系列。他还自曝曾错过Transformer,当时未在意其优势。

新智元
新闻资讯8

Transformer作者:DeepSeek才有搞头,OpenAI指望不上了

Transformer发明者Ashish Vaswani认为OpenAI等闭源厂商被商业化冲昏头脑,没心思做基础研究。他All in基础研究,坚持开源路线,想打造西方世界的DeepSeek。其团队论文提出颠覆性观点,或降低训练成本。

量子位
算法论文7

人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架

人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。

CourseAI
新闻资讯8

盲人复明!马斯克Neuralink联创实现人工视觉里程碑

Nature刊登人工视觉研究PRIMA,其让70岁失明奶奶重获光明。该研究由Neuralink联创带队,视网膜植入物使80%患者视力显著改善。PRIMA能逆转恢复视力,与传统疗法不同,已申请监管批准。

量子位
新闻资讯7

刚刚,OpenAI新Transformer火了!Astra架构首次曝光

OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。

新智元
算法论文8

DeepMind:Transformer存在拓扑缺陷,思维链治标不治本

谷歌DeepMind论文指出,Transformer架构不擅长追踪状态,思维链只是给结构性缺陷打补丁,成本高。论文主张用循环架构替代或补充纯前馈结构,还提出多个研究方向,认为下一代模型需构建‘流动的现实表示’。

机器之心
开源动态7

Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签

在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。

机器学习AI算法工程
算法论文8

欲取代transformer的SSA(次平方稀疏注意力)解读

文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。

Agent的潜意识
推荐文章7

「Memory as a Context」是否将重新定义 Transformer 的 「记忆模式」?

本期机器之心PRO会员通讯解读3个AI业内要事,包括「Memory as a Context」能否重新定义Transformer记忆模式、世界模型发展情况,以及OpenRouter联合a16z发布的《State of AI》报告。详细探讨了谷歌Titans架构及其理论框架MIRAS,还提及业界对LLM记忆力的改进方案。

机器之心
新闻资讯8

Transformer论文作者之一Noam Shazeer宣布离开Google,加入OpenAI

6月18日,Google DeepMind工程副总裁、Gemini模型联合负责人Noam Shazeer宣布离开Google加入OpenAI。他是Transformer架构提出者之一,技术实力强。Google曾花27亿美元请他回归,仍没留住。

DeepTech深科技