「多模态架构」共找到 2580 篇相关文章
NextStep-1:一次在图像生成上自回归范式的探索
阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。
PolarDB Supabase Edge Functions - 让函数,随时可用
文章介绍 PolarDB Supabase Edge Functions,它是为全栈应用打造的边缘计算方案。提供 CLI 和 Studio 两种开发方式,补全开源版缺失的管理后台,让企业能兼顾功能与控制力,还提及数据库原生多模态智能检索方案。
ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化
近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。
直接从像素到单词:这个原生大模型统一单图、多图、视频和空间智能
南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。
阿里SkillClaw:让 Agent 技能在真实使用中集体进化
当前LLM Agent依赖可复用技能完成任务,但技能部署后静态不变,改进仅停留在当前会话。阿里SkillClaw提出中心化进化架构,将多用户交互作为技能改进信号,通过Agentic Evolver更新技能,经夜间验证后部署。
英伟达改卖Token?黄仁勋GTC后发声:token就是AI新通货,值钱的不是算力,是“每度电的智商”
英伟达黄仁勋在采访中强调其是加速计算公司,非单纯 GPU 公司。他认为 AI 竞赛从拼算力变拼产出,token 是新通货,还阐述了 AI 瓶颈、架构发展、推理编程、CPU 角色等观点。
500行极简开源框架,硬刚GPT/Gemini视觉极限!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。
苹果掀桌!扔掉AlphaFold核心模块,开启蛋白折叠「生成式AI」时代
蛋白质折叠是计算生物学核心难题,SimpleFold作为首个仅基于通用Transformer模块的蛋白折叠模型,摒弃AlphaFold2系列传统架构,能将蛋白序列生成三维原子结构,在多基准测试表现强劲,还可生成结构集合。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
中国科大Science-Star(科星) : 一体化、可扩展的科学智能体搭建平台
中科大认知智能全国重点实验室开发了 Science - Star 科研智能体平台。它基于 ReAct 引擎,有一体化可视化支持、插拔式模块化架构和跨学科工具集成等特色,为科研智能体研发与实验提供高效基础设施。