「多模态生成模型」共找到 8884 篇相关文章
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。
“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!
Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。
想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下
阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
英伟达让机器人「做梦学习」,靠梦境实现真·从0泛化
英伟达推出DreamGen项目,让机器人‘做梦学习’。它利用视频世界模型生成神经轨迹,仅少量现实视频就能让机器人学会新任务,实现从0泛化,还将助力GR00T - Dreams发展。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%
昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。
英伟达再破世界纪录,每秒1000 token!刚刚,全球最快Llama 4诞生
英伟达用Blackwell创下AI推理新纪录,单节点8颗GPU实现Llama 4 Maverick模型每秒单用户生成1000个token。这得益于技术组合拳,如用TensorRT - LLM优化、应用FP8格式等,满足了低延迟需求。
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。