「多模态视觉理解模型」共找到 1933 篇相关文章
面向6G环境感知通信!西电开源3Dx3D无线电地图数据集与生成式基准框架
面向6G,西安电子科技大学等团队联合提出高分辨率多模态三维无线电图谱数据集UrbanRadio3D,构建三维无线电图生成框架RadioDiff-3D,弥补了当前主流RM构建方法与数据集的局限。
AI 落地实录:我们如何重构业务流程与组织协作
InfoQ《极客有约》X AICon 直播栏目邀网易蓝师师、腾讯张瀚元、国际头部 ERP 企业吴云,探讨 AI 重塑业务价值与提升效能。分享各行业 AI 提效实践、业务重塑案例,还讨论 AI 应用方向及落地挑战等。
吴恩达来信:美国的“大而美法案”将如何影响AI监管
吴恩达认为美国“大而美法案”未纳入“暂停州一级AI监管”条款很遗憾。早期AI监管易被企业利用打击开源,虽有合理监管措施,但多数州级提案负面影响大,应暂停州级监管。
中国中文信息学会大模型与生成专委会2025大模型战略研讨会成功举办
2025年6月27日,中国中文信息学会大模型与生成专委会2025大模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦大模型多方面话题。
OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!
半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。
狂涨 9.5K star!!又一款轻量好用的web自动化项目,太爽了!!
介绍开源项目Nanobrowser,它是基于Chrome扩展的AI网页自动化工具,通过多智能体协作系统理解自然语言指令完成复杂网页任务,开源免费、保障隐私,有诸多实用功能,已获9.5K star。
统一架构新思考,北大团队UniWorld-V1统一大模型
北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究。
李飞飞空间智能独角兽开源底层技术!AI生成3D世界在所有设备流畅运行空间智能的“着色器”来了
李飞飞创立的World Labs开源核心技术Forge渲染器,可在各设备实时、流畅渲染AI生成的3D世界。它是Web端3D高斯泼溅渲染器,地位似传统3D领域“着色器”,还解决了3DGS渲染难题。
LSTM之父22年前构想将成真?一周内AI「自我进化」论文集中发布,新趋势涌现?
本文介绍AI模型自我进化方向的进展,涉及多机构的相关论文。如受“哥德尔机”启发的“达尔文哥德尔机”可自我改进;还有“自我奖励训练”“MM - UPT”“UI - Genie”等方法,展现AI自我进化潜力。
谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相
谷歌在I/O大会放大招,升级所有AI模型,重做原有产品,推出诸多实验性新产品。如Gemini 2.5系列升级,具备新功能;还有异步代码助手Jules、新搜索模式等,多模态模型也全线升级。