「视觉注意力机制」共找到 1563 篇相关文章
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了
斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。
简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?
本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。
DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了
过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。
“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷
上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。
B站发布最强零样本TTS,IndexTTS2情感可控、时长精准
在大规模TTS系统中,自回归模型难精准控制语音时长。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。
AI 陪伴硬件的反共识讨论:主体性很重要,同质化竞争不存在
文章围绕AI陪伴硬件展开讨论,邀请创业者探讨产品角色定位、性别设定、用户反馈等问题。指出产品应注重主体性,避免破坏角色感,还提及应对同质化竞争、产品寿命、视觉研究等方面的思路。
只用2700万参数,这个推理模型超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。
AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩
国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。
开源首月斩获 1K+ star!大学生开发web终端工具,颜值高、功能强,真吊啊~
传统远程终端工具存在界面单一、功能有限等问题。大学生开发的开源Web应用Nexus Terminal,集成SSH等三大协议,有多重安全机制,适合中小团队运维等,开源首月获1K+ star。