Matrix - Game 2.0」共找到 2471 篇相关文章

算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
产品应用7

B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)

B站发布TTS模型IndexTTS2,亮点是实现时长控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心模块组成,还可能是代号H的AI创作工具一环。

量子位
产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
新闻资讯7

“iFold”,苹果AI新成果

苹果发布基于流匹配的蛋白质折叠模型SimpleFold,被戏称“iFold”。它用通用Transformer模块搭配流匹配生成范式,3B参数版本追平谷歌AlphaFold2性能,还解决了传统模型算力依赖问题,效率高。

量子位
算法论文7

AI真的能读懂人心吗?阿里通义最新研究成果揭示答案

文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。

CourseAI
产品应用7

用AI把一段视频变成可视化网页,Google的新模型又卷飞了。

Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。

数字生命卡兹克
新闻资讯7

天塌了,Pro用户用不了Claude Code,除非100美元买Max

Anthropic 悄悄修改价格页面,将 Claude Code 从 20 美元 Pro 套餐剔除,变为 100 美元 Max 套餐专属。开发者反应激烈,官方称是针对 2% 新用户的定价测试,OpenAI 借机拉踩,网友质疑,开发者开始物色下家。

机器之心
新闻资讯8

当Gemini 3刷屏时,这款AI已开始救命了:原子级攻克「不可成药」靶点

全网关注Gemini 3时,Chai-2已开启生物学界「AlphaFold时刻」。它能原子级精准设计出可进临床的抗体药,攻克「不可成药」靶点,让很多难治疾病看到新药希望,AI造药开始起飞。

新智元
产品应用7

Proactor AI:首个自主行动的AI 智能体,无需唤醒,就能主动识别对面是个骗子

Proactor AI v1.0发布,号称是世界首个「自主行动」的AI队友。它能感知、思考并自主行动,如识别骗局。还提供主动式AI服务,应用场景广泛,用户反响热烈,带来人机交互范式转变。

AGI Hunt
产品应用7

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

AI短剧火爆,但创作者面临成本高痛点。Agnes Video 2.5系列模型上线Pavo平台,成本低效果好,其Flash版免费。Pavo还有「无限画布」和「Agent创作模式」,降低返工成本,实现低门槛创作。

新智元