可灵2.5」共找到 6562 篇相关文章

算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
算法论文8

ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!

情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。

AI前线
产品应用7

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

AI短剧火爆,但创作者面临成本高痛点。Agnes Video 2.5系列模型上线Pavo平台,成本低效果好,其Flash版免费。Pavo还有「无限画布」和「Agent创作模式」,降低返工成本,实现低门槛创作。

新智元
新闻资讯7

Fable第一,谁第二?Anthropic钦点8款模型名单曝光

Anthropic官宣Claude Fable 5全球上线,公布安全测试结果,8款模型包括中国的Kimi K2.7。北美公司也用行动认中国模型,Kimi在多方面表现出色,其商业模式类似Anthropic,未来潜力大。

新智元
新闻资讯8

ChatGPT「群聊」功能正式开启内测

OpenAI正式在部分地区试点ChatGPT群聊,覆盖移动端和网页端。该功能用于生活娱乐、工作学习等场景,由GPT - 5.1 Auto模型驱动,操作简单,还考虑了隐私与控制。

AI寒武纪
产品应用7

Nano Banana 邪修之王最强科研成果!教你自定义生图比例!

Nano Banana 出图有分辨率低和比例不控问题。作者发现用垫图方式控制其生图比例,已生成图片也适用,还给出操作方法、提示词,介绍不同平台效果及案例图下载方式。

歸藏的AI工具箱
新闻资讯8

DeepSeek 跃居全球第二 AI 实验室,中美正式并驾齐驱!

Artificial Analysis宣称DeepSeek R1跃居全球第二,其0528版得分达68分,与Google Gemini 2.5 Pro并列。更新体现强化学习的重要性,多家云服务提供商也迅速支持新模型,这表明开源与闭源模型差距缩小,中美AI并驾齐驱。

AGI Hunt
开源动态8

刚刚,美团开源全模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分

美团发布开源全模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正全模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。

AGI Hunt
新闻资讯7

ChatGPT还没学会打电话,谷歌搜索AI已经替你电话约服务,还会谈价砍单!

谷歌搜索迎来三大AI革新,集成Gemini 2.5 Pro模型、用Deep Search功能,最亮眼的是AI代打电话功能。目前该功能在美国上线,未来将全球推广,引发网友对其效果和实用性的讨论。

新智元