「多模态系统」共找到 2526 篇相关文章
Cursor 1.7 新增 Agent 生命周期管控钩子函数
Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。
按token 计费,真的合理吗?
马克斯·普朗克软件系统研究所论文揭露,同样文本可被切分成不同数量token,用户难以验证是否被多收费。研究团队开发算法展示服务商多收费手段,还指出按字符计费可解决问题,但需行业达成共识。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
Midjourney正式推出 V1 视频模型:美学细节无敌
Midjourney推出视频生成模型V1,主打高性价比、易上手。采用“图像转视频”工作方式,有两种动画和运动幅度设置。入门价每月10美元,任务成本低,未来一月或调价格,目标是实现实时交互开放世界模拟系统。
完全透明开源的共情语音大模型,三阶段训练,四大模块实现端到端对话 | 紫东太初联合长城汽车开源OpenS2S
GPT - 4o、Gemini等顶级语音模型闭源,紫东太初团队联合长城汽车AI Lab开源端到端共情语音语言大模型OpenS2S,提供构建共情语音系统新范式,开源所有核心资源,还介绍了技术方案、数据构建及训练流程等。
深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas
近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
阿里的未来,是通往超级人工智能
云栖大会上,阿里巴巴 CEO 吴泳铭演讲传达阿里对 AI 发展判断与战略规划。他认为 AGI 非终点,ASI 是目标,并提出实现三阶段。还指出阿里抓住大模型和 AI Cloud 支点,要把通义千问打造成 AI 时代 Android 系统。