多模态指令数据合成」共找到 3385 篇相关文章

开源动态8

深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?

昨天,Meta发布约30B参数的多模态Agent模型Muse Glimmer,支持128K级上下文。它采用Apache 2.0许可证开放,有量化版本等。其技术设计围绕显存、上下文管理等问题展开,在多方面做了取舍。

AI科技评论
算法论文8

ICLR 2026 | CineTrans: 首个转场可控的多镜头视频生成模型,打破闭源技术壁垒

随着视频生成模型发展,影视级长视频需多镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。

机器之心
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。

InfoQ
新闻资讯8

刚刚,OpenAI发布「科研写作神器」Prism,Overleaf危

今天凌晨,OpenAI推出专为科学家打造的AI原生协作平台Prism,由GPT - 5.2驱动,解决科研工具碎片化问题。即日起向ChatGPT个人账户用户免费开放,功能或覆盖Overleaf,也引发数据安全等讨论。

机器之心
推荐文章8

给非技术人的大模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案

文章介绍从零训练ChatGPT级别大模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用大模型,将专有数据视为核心资产。

AI Reading Hub
算法论文8

ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力

美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。

机器之心
算法论文8

CVPR 2026 | EmoStyle:情感也能“风格化”?深大VCC带你见证魔法!

EmoStyle由深圳大学可视计算研究中心黄惠教授课题组完成。它解决图像情感风格化两大挑战,提出有效方法、构建数据集、设计模块。实验显示其平衡情感与内容,还能扩展到文生图。

机器之心
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
产品应用7

Fable 5 刚被封杀,OpenRouter 用「多模型协作」搞出了「平替天团」

2026年6月14日,OpenRouter推出复合模型Fusion API,可复刻Claude Fable 5智力水平。它采用多模型协作,经DRACO测试效果出色,成本减半,但也有编程不实用、速度慢、数据合规存黑箱等问题,重塑了AI行业逻辑。

AI科技评论
8

我用MiniMax Agent开发了个带后端的全栈网站,全程0代码

2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。

花叔