模长感知」共找到 955 篇相关文章

新闻资讯7

200亿国产巨头,在这个赛道做到了全球第一

声学传感器龙头歌尔微电子冲刺港交所,它是全球第五大、中国第一大智能传感交互解决方案提供商,全球第一大声学传感器提供商,市场份额达43%。其发展历程,技术投入大,虽面临挑战,但上市后未来可期。

芯师爷
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源型,有强大推理、语义理解能力,支持中英文文本渲染。

新智元
推荐文章7

蚂蚁武威:下一代「推理」型范式大猜想

文章围绕下一代「推理」型范式展开,蚂蚁技术研究院武威提出不同观点,认为思维链推理未必最优,未来推理型或更低维稳定,还探讨推理定义、重要性及解法猜想,如结合快慢思考等。

AI科技评论
开源动态8

开源 AI 视频平台

开源 AI 视频平台集成剪辑生成器、AI 短视频、YouTube 工作室三大工具,能将视频转短视频,为业务生成营销视频,还具备免费 YouTube 工具包。支持多平台发布,自托管永久免费。

GitHubStore
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技

InfoQ对话格灵深瞳灵感实验室,探讨多态大型下视频理解问题。指出传统视频型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
开源动态8

告别“音画割裂”与“人物崩坏”!AutoMV:首个听懂歌词、卡准节拍的开源全曲级MV生成Agent

现有AI视频生成型做全曲MV有时限制、音画割裂和一致性差等问题。AutoMV作为开源多智能体系统,拟人类影视制作流程,能生成达数分钟、叙事连贯且音画同步的完整MV。

量子位
新闻资讯8

Google封神,计算机视觉的GPT3时刻来了!

Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建等四大超能力。

探索AGI
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和型上验证有效,性能提升显著。

深度学习自然语言处理
开源动态8

Transformer创新架构SALA:上下文更,推理更快

面壁智能发布行业首个大规训练的稀疏 - 线性注意力混合架构 SALA 及文本型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在文本处理及推理上表现出色,还发起大奖赛探索性能极限。

PaperAgent
新闻资讯7

近亿元融资落定!隼瞻科技加速芯片设计"敏捷革命"

近日,隼瞻科技完成近亿元天使+轮融资,多家知名战略投资人加入,老股东继续加持。该公司是国内唯一‘IP货架 + EDA工具’双轮驱动企业,自研平台可大幅缩短设计时,成立三年已迈向规化落地。

芯师爷