视听场景理解」共找到 2620 篇相关文章

产品应用7

豆包上可以体验 Seedance 2.0 了,我已经试了一下。

Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。

宝玉AI
推荐文章8

Claude code让程序员消失,Anthropic却说用AI编程会让你变傻

Anthropic科学家实验发现,新手过度依赖AI编程,概念理解、代码阅读和调试能力显著退化,效率未提升。研究识别六种AI使用模式,指出主动思考才是技能形成途径,应保留人脑训练的“摩擦力”。

AIGC开放社区
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理长音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景

开源星探
产品应用8

豆包,即将杀死比赛

本文讲述作者在不同场景的经历,展现豆包在大众心中的高认知度。还提及豆包用户规模领先、被业内人士使用、成内容创作热点等,且将深度嵌入春晚,或强化“AI = 豆包”印象。

特工宇宙
新闻资讯8

硅谷AI战火烧进医院!终于可以告别「天书」化验单了

OpenAI和Anthropic的战火燃至医疗领域,OpenAI发布ChatGPT健康,Anthropic推出医疗健康版Claude,还打通数据壁垒,提供个性化健康解答。其还在提升模型能力,保障隐私安全,且各有应用场景

新智元
算法论文8

GAG:超越RAG,无需检索的私有知识注入新范式

在高价值私有场景,主流大模型注入知识的路线各有硬伤。中科院和360AI联合团队提出GAG方案,无需检索、固定底座、单Token、即插即用,实验显示效果佳,也指出跨域组合等局限。

PaperAgent
算法论文8

上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」

上海科技大学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。

AI科技评论
新闻资讯7

抨击AI炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!

Anthropic由7位前OpenAI核心成员创立,联合创始人兼总裁Daniela Amodei接受采访,谈到成本控制、AI安全及上市可能。她认为AI安全是核心优势,公司谨慎对待支出和算法效率,虽算力投入大,但硬件回报高。

AI前线
开源动态8

阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!

2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。

开源星探
推荐文章7

2026 将近,世界模型到底更「世界」了吗?

近期 Runway 发布相关产品,让「世界模型」讨论再聚焦。其定义从强化学习语境延伸,业内理解不断变化,概念边界变模糊。如今被推到和 LLM 同级,出现概念同名但内核分裂现象。

机器之心