图像超分」共找到 2992 篇相关文章

开源动态8

谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星

今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成强编码助手,刚开源就在Github9000颗星。

AIGC开放社区
算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智离"新范式

当前大视觉语言模型处理复杂推理任务时,常过依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
开源动态8

不愁了!开源智能体Paper2Poster「一键生成」学术海报

2025年5月,滑铁卢大学等团队发布Paper2Poster系统,用大模型将论文自动生海报。它提出PosterAgent多智能体方法,解析、规划、绘制优化三阶段,生成效果好且开源,不过也存在效率和创意不足问题。

机器之心
新闻资讯7

突发|立即检查你的Python库!LiteLLM被投毒,Karpathy警告,马斯克关注

Karpathy发长推文警告,GitHub4万星、月下载量9700万次的Python库LiteLLM在PyPI上被投毒,含恶意代码版本为1.82.7和1.82.8,攻击负载三阶段运行,引发马斯克关注。

机器之心
开源动态8

从“造工具”到“用仓库”:RepoMaster,驾驭GitHub解决复杂任务的智能体大师!

RepoMaster旨在让AI智能体解决复杂开发任务。它能利用深度搜索定位GitHub仓库,其核心框架三步闭环解决智能体‘看不懂、用不来’难题。实验显示它性能主流框架,效率高,设计科学。

AI科技评论
开源动态8

Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana

北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。

AI工程化
开源动态8

NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!

英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅 Qwen2.5 - Omni,且训练量仅为其六之一。其架构经多阶段流程实现全模态理解,还支持多种功能。

带你学AI
产品应用8

Meta首个Agent生图模型登场,空降竞技场第二

Meta智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。

AI寒武纪
新闻资讯7

“75亿元投资理财”?摩尔线程回应

近期,摩尔线程拟将IPO募集的不75亿元闲置资金用于现金管理引关注。公司称募投项目阶段投入,此举为提高资金使用效率,不影响项目推进。12月20 - 21日将举办开发者大会。

芯师爷
新闻资讯7

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。

新智元