多码本视觉表示」共找到 934 篇相关文章

开源动态7

长视频会议纪要、访谈节目精剪AI神器

WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。

GitHubStore
产品应用7

谷歌发布 Gemma Scope 2,深化对 LLM 行为的理解

Gemma Scope 2 是谷歌推出的解释 Gemini 3 模型行为的工具,结合稀疏自编码器和转码器,能让研究人员检查模型内部表示。它从多方面扩展了原先的 Gemma Scope,还引入针对聊天机器人的分析工具,已发布权重。

InfoQ
新闻资讯7

抨击 AI 炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!

Anthropic 由 7 位前 OpenAI 核心成员创立,联合创始人兼总裁 Daniela Amodei 在接受采访时表示,“AI 安全”是核心优势,企业客户对安全性的高要求与之匹配。Anthropic 以“不要相信炒作”为价值观,谨慎对待支出和算法效率。

InfoQ
开源动态8

让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen

NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。

AIGC开放社区
新闻资讯7

黄仁勋称英伟达中国份额从95%降至0%

近日英伟达CEO黄仁勋出席美国城堡证券活动时表示,因美国出口管制,英伟达中国市场份额从95%降至0%,美国此举或也会伤害自身。他认为监管AI要深思熟虑,应平衡技术领先与吸引全球研究人员。

芯师爷
算法论文8

用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架

华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。

量子位
新闻资讯7

16岁炒马斯克鱿鱼,SpaceX天才转投北大数学校友赵鹏麾下

16岁天才Kairan Quazi从SpaceX离职,入职全球顶尖量化交易公司Citadel Securities。他曾14岁毕业于圣克拉拉大学,被马斯克选中加入SpaceX。他表示量化金融反馈快、结果直观,且新公司欣赏他的非传统背景。

量子位
新闻资讯8

DeepMind掌门自曝AGI倒计时5年!算力需求暴增10倍,推理计算吞噬一切

在最新播客中,DeepMind掌门Hassabis表示自然界规律能被机器学习算法模仿。他畅想AGI应用于游戏,还提及迈向AGI要扩大计算规模,算力需求或增10倍,且运营上以初创公司模式兼顾研究与产品。

新智元
新闻资讯7

谷歌 DeepMind 发布机器人学基础模型 Gemini Robotics On-Device

谷歌 DeepMind 推出 Gemini Robotics On-Device,这是视觉 - 语言 - 行动基础模型,可在机器人硬件本地运行,低延迟且能针对特定任务微调。它是 Gemini Robotics 家族最新迭代,还发布相关基准测试。模型待广泛可用,SDK 可在 GitHub 找到。

InfoQ
开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face