多模态内容」共找到 1707 篇相关文章

产品应用8

谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude

谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。

新智元
产品应用7

MiniMax Agent 接管桌面:动动嘴,电脑就把活干完了 | 10+个技巧分享

介绍 MiniMax Agent 桌面端,它是 Web 端进化版,能控制浏览器、处理本地文件。文中分享了其使用技巧,如环境配置、文件管理、垃圾清理等,还提及多种实战场景及玩法,凸显其主动性优势。

AI进修生
产品应用7

国内首个!360发布“纳米漫剧流水线”,AI漫剧生成进入工业化时代

1月29日,360宣布国内首个工业级AI漫剧智能体生产平台“纳米漫剧流水线”公测。它整合多环节,素材生成成功率超90%,单集制作缩至1小时内,已和多家公司合作,推动构建行业标准。

量子位
开源动态8

欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者

欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。

AIGC开放社区
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
算法论文8

Feed-Forward 3D综述:三维视觉如何「一步到位」

这篇由12所机构联合撰写的综述论文,总结2021 - 2025年间数百项创新工作,建立Feed - Forward 3D方法谱系与时间线,介绍五大技术分支、应用场景、评测指标与结果,还指出未来挑战与方向。

机器之心
推荐文章8

Google内部文档深度解析与AI模式用户行为研究

文章基于Google 2024年泄漏内容数据仓库逆向分析,解构其排名流程,解析核心指标与E - E - A - T,还介绍AI模式用户行为研究,为SEO提供启发与检查清单。

白杨SEO优化教程
开源动态8

手机操控革命!开源手机AI Agent,自然语言操控Android/iOS!

传统移动设备自动化工具难实现自然语言控制和跨应用交互,开源项目Mobile - Use提供解决方案。它由Minitap AI开发,能通过自然语言指令实现设备UI感知自动化,功能丰富,应用场景广。

开源星探
新闻资讯7

华纳兄弟起诉Midjourney

Theverge消息,华纳兄弟起诉文生图平台Midjourney,称其AI工具生成大量侵犯版权的角色图像和视频,如蝙蝠侠、超人等。诉状列举侵权行为,提供对比案例,华纳希望获禁令并索赔。

AIGC开放社区
新闻资讯7

美国航天局与谷歌合作,打造AI医疗助手,以保证宇航员健康

Techcrunch消息,美国宇航局NASA和谷歌合作开发AI医疗助手CMO - DA,保障前往火星的宇航员健康。它有多种模态功能,在谷歌云运行。经测试诊断准确性较高,未来还会增加数据源和情境感知能力。

AIGC开放社区