「第一人称视听基准」共找到 935 篇相关文章
每周产业洞察 | AI影视文艺复兴已至,未来24个月内容供给将迎结构性变化
北京AIGC视听产业创新中心位于朝阳区,由多方参与、首创郎园负责运营,通过六大服务平台促进成果转化与场景落地。截至2025年8月已汇聚60余家生态伙伴,首创郎园拓展多地业务。
卷疯了!2.2k Star通用型、开源Agent平替Manus、GenSpark AI
2025 年是 Agent 之年,文中介绍了 Manus、GenSpark AI 两款闭源代理,还重点阐述开源的 II - Agent,它功能丰富,架构设计合理,在 GAIA 基准测试评估,性能可平替前两者。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
近日,智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,打破具身智能演进制约。
Alibaba开源WebDancer解决DeepResearch复杂信息检索难题
Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。
每周产业洞察 |95分钟AI长片登上戛纳,会用AI的传统影视人 ,正在成为“稀缺产业资源”
北京AIGC视听产业创新中心位于朝阳区,由多方参与,采取‘共创、共建、共享’模式。首创郎园负责运营,提供六大服务平台,截至2025年8月汇聚近百家生态合作伙伴。首创郎园不断拓展服务能力边界。
谷歌智能体发力:增强版Gemini Deep Research和专属API都来了
OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。
Nature新研究:AI竟然分不清事实和信念
斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
每周产业洞察 | 从史努比交易看AI时代:手握存量IP的巨头如何开辟新路径
北京AIGC视听产业创新中心位于朝阳区东坝乡,是朝阳区推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家生态伙伴。首创郎园拓展服务边界,项目多地布局。
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。