视觉注意力机制」共找到 1561 篇相关文章

新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
新闻资讯8

72小时狂揽50万美金GMV,AI短剧出海真正改变了什么?|甲子光年

2026年AI短剧与一人公司碰撞出新产业形态,海外市场规模将突破6.5亿美元。YourChannel平台创新分发与分账机制,让创作者快速变现,其模式与传统平台差异大,未来内容产业竞争重心或向token消耗权转移。

甲子光年
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
新闻资讯7

独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
新闻资讯7

图灵巨头反水!ICML新规血洗学术圈,学术散户只能「裸奔」

2025年NeurIPS投稿量大增致评审系统危机,ICML 2026推出作者自评级新政。图灵奖得主Bengio支持,认为可利用‘偏见’降噪。但该机制对只投一篇论文的‘学术散户’不利,或奖励‘灌水’。

新智元
新闻资讯7

哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈

哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。

量子位
7

向黄仁勋汇报的英伟达36人

文章曝光向英伟达CEO黄仁勋汇报的有36人,分属七个职能板块。硬件是基石,AI等成“第二支柱”,还需系统化对外沟通机制,文中介绍关键将领,也谈及管理模式变化及高压文化。

量子位
算法论文8

AEPO:智能体熵平衡策略优化,让探索更稳,推理更深!

中国人民大学与快手团队联合提出 AEPO 算法,解决熵驱动式智能体强化学习训练不稳等问题。它设计两项核心机制,在 14 个基准上优于主流算法,在 X 等平台获高关注。

机器之心
开源动态8

集合通信库VCCL释放GPU极致算力,创智、基流、智谱、联通、北航、清华、东南重磅开源

在超大规模智算集群需求下,创智、基流等多方联合开源集合通信库VCCL。它基于NCCL开发,有智能调度、容错、细粒度观测机制,实测能提升算力利用率、降低故障率,还解决了服务器异构等问题。

机器之心
算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心