「多模态代码生成」共找到 4181 篇相关文章
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。
V4Flash 的价格、Opus4.8的能力,Ox Alpha (牛来)正式开源!
Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。
AI时代,这三个认知你需要转变
文章指出多数人用AI和用搜索引擎无异,分享三个认知转变。一是从需求侧到供给侧,要思考创造新能力;二是Coding成新‘识字’,需理解代码逻辑与AI协作。
ICLR 2026 放榜了!28%接收率,欢迎投稿机器之心
ICLR 2026 官方深夜发论文接收结果,会议 2026 年 4 月在巴西举行,收稿约 19000 篇,录取率约 28%。网友晒成绩,不过本届堪称“史上最乱”,有审稿问题,还被质疑用 AI 生成意见。
你们问了一万遍的票据风图片提示词,它终于来了!
文章分享票据风图片提示词,还将此风格打包成 Skills。该 Skills 能批量为文档生成配图和封面,有多种格式、分辨率等选项,内置三套风格,还介绍了安装和使用方法。
告别工具焦虑:2026年真正值得用的8款AI效率外挂
文章指出2026年是‘AI深度融合’元年,工具使用进入‘重塑工作流’阶段。作者筛选出Gemini全家桶、OpenCode等8款‘硬核’AI工具,介绍其特点和优势,如多模态、不设限、易用等。
想清楚再动手:具身智能也要学会脑补未来和择优执行 | RSS 2025
近年来基础模型在具身智能领域能力惊人,但在真实部署中常‘用不好’。卡耐基梅隆大学与伯克利人工智能研究院团队提出 FOREWARN 框架,结合‘世界模型’与‘多模态语言推理’,解决部署智能难题。
数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了
香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。
深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?
昨天,Meta发布约30B参数的多模态Agent模型Muse Glimmer,支持128K级上下文。它采用Apache 2.0许可证开放,有量化版本等。其技术设计围绕显存、上下文管理等问题展开,在多方面做了取舍。
4 天 20K+ Star!VoltAgent 最新开源力作,让 AI 直接掌握各大网站的设计风格!
VoltAgent团队推出新开源项目awesome-design-md,上线4天20K+ Star。它准备50+现成的`DESIGN.md`,从真实网站提取设计系统,让AI按其生成UI,解决开发者用AI写UI的痛点。