「多模态开发」共找到 2442 篇相关文章
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。
MotlBot作者被Claude刁难后:MiniMax M2.1是最优秀的开源模型
Moltbot热度不减,开发者挖掘其实用价值,阿里云、腾讯云上线相关云服务。Moltbot作者Peter接受采访,分享项目起源、开发思路等,认为MiniMax M2.1是优秀开源模型,还探讨了智能体发展及项目后续规划。
摩尔线程AIBOOK一周实测:开箱即训的「AI Native」体验
摩尔线程AI算力本MTT AIBOOK专为AI学习与开发者打造。它搭载「长江」芯片,提供50TOPS异构AI算力,运行MT AIOS系统,预置完整AI开发环境。实测显示其部署简单,性能出色,还具备端云一体等优势。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
按token 计费,真的合理吗?
马克斯·普朗克软件系统研究所论文揭露,同样文本可被切分成不同数量token,用户难以验证是否被多收费。研究团队开发算法展示服务商多收费手段,还指出按字符计费可解决问题,但需行业达成共识。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍
Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。
腾讯出手了!彻底入局Agent
腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点多,如可一键发布到企业微信,具备多工具调用、多Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。
深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas
近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。