「多模态架构」共找到 2594 篇相关文章
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
这大概是我见过最通俗易懂的AI发展历程科普详文了
文章从历史时间线出发,介绍AI诞生、发展历程,涉及细分技术模块。结合案例说明AI在不同阶段的应用,如早期机器翻译、垃圾邮件过滤。还探讨AI大模型、智能体等概念,分析调优方法和‘幻觉’问题,展望其未来前景。
黄仁勋GTC开场:「AI-XR Scientist」来了!
英伟达CEO黄仁勋在GTC大会展示LabOS,这是全球首个融合AI与XR的协研科学家平台。它将多模态感知等技术融合,构建端到端闭环,还通过三大生物医学案例展示功能,开启人机协同科研新纪元。
终于,TRAE SOLO全量开放,我们用它复刻了PewDiePie的大模型智囊团
2025年AI Coding赛道上,TRAE是国产AI IDE代表作。7月其SOLO Beta版反响好,如今正式版全量推送。它定位为‘具备响应感知的编程智能体’,新增功能,还限时免费体验,实测显示开发能力强。
全新SkyReels发布,昆仑万维要通吃创意生态 | 甲子光年
11月4日,昆仑万维发布全新SkyReels,定位“一站式、零门槛多模态AI创意平台”。它有无限画布、智能副驾、AI视频模板三大革新,重构创作流程。其技术进化快,还加入平面设计功能,有望撬动更大应用市场。
北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o
北大和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理全过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。
斯坦福7B智能体全面超越GPT-4o,推理流登顶HF
传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。
L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式
在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。
全面拥抱AI Agent,从0到1动手用GPTBots搭建企业数字助理智能体,办公效率翻倍~
文章指出当下Agent/Agentic AI是热门风口,企业级智能体受资本追捧。重点分享运用GPTBots平台从0到1搭建企业数字助理智能体,涵盖架构、流程、设计、测试等内容,介绍选择该平台的原因及实践成功关键。
AutoGLM 2.0 深度解析:云端智能体的技术跃进与现实挑战
2025 年 GUI Agent 赛道升温,多数产品依赖本地执行。智谱 AI 在 8 月 AutoGLM 2.0 闭门交流会上展示新路径,其由国产模型驱动,具多能力,在 Agent 云端执行架构、训练方式等方面有突破,也面临一些挑战。