场景理解」共找到 2572 篇相关文章

算法论文8

高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线

现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心
推荐文章8

打字太慢?2026年开发者语音输入终极指南:12款工具横评,找到最适合你的那一个

文章是 2026 年开发者语音输入工具横评。指出 AI 编程时代语音输入成刚需,介绍 12 款工具优缺点、适用场景和价格,还给出使用技巧,作者分享自己的选择组合。

AI Reading Hub
产品应用8

阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合

阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。

AIGC开放社区
产品应用8

AI Coding后端开发实战:解锁AI辅助编程新范式

文章指出AI Coding应用中开发者存在认知误区,基于实践为后端开发者提供使用指导。涵盖个人上下文管理、输出质量判断等内容,介绍核心使用流程,涉及项目开发、脚本处理等场景及最佳实践。

阿里云开发者
推荐文章7

一文探析多分类指标Accuracy/Precision/Recall/F1-score

文章探讨机器学习分类模型评价指标,指出Accuracy在不平衡数据集有缺陷,需引入Precision、Recall和F1 - score。分开解析二分类和多分类模型指标,还给出不同场景下指标侧重建议。

海边的拾遗者
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
新闻资讯7

没有头,没有脚,还能三折叠,周衔团队发布首款「非人形」机器人

机器人创业公司Genesis AI发布首款通用机器人Eno,它是轮式且配机械臂,无腿无头部,外壳颜色可定制。其由自研模型GENE驱动,预计2026年Q4发货,落地从工业到生活场景

机器之心
开源动态7

GSD框架解析:解决AI编程工具Context Rot的工程化方案

文章介绍GSD框架,它旨在解决AI编程工具的Context Rot问题,通过Meta - prompting等方法将开发过程阶段化。提供常用命令稳定工作流,有实用新能力,适用于多种场景,以npm包部署,支持多平台。

小华同学ai
开源动态8

港大开源视频版RAG,像聊天一样看完百小时纪录片。

港大HKUDS团队开源超长视频理解框架VideoRAG,突破传统模型时长限制,支持对数百小时视频精准检索和问答。还有桌面应用Vimo,使用简单高效。介绍了其切片索引、混合检索、生成回答的实现逻辑。

开源AI项目落地
新闻资讯8

UC伯克利大牛预警:留给人类能干的活,只剩5年了!

UC伯克利教授Sergey Levine预言,2030年前机器人将进入真实世界,接手厨房、客厅等场景,甚至工厂、仓储和数据中心建设。其基于Robot Foundation Models等进展,认为‘自我进化飞轮’启动后不会停下,还会带来经济冲击。

新智元