「多条件组合」共找到 4317 篇相关文章
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?
伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。
AI生成苹果Metal内核,PyTorch推理速度提升87%
Gimlet Labs研究显示,AI能自动生成苹果芯片Metal内核,使PyTorch推理速度提升87%,在215个PyTorch模块上平均加速1.87倍。多个模型组合生成最优内核概率更高,不过研究对比方式遭质疑。
一手评测Seedance 1.0 pro,字节首次登顶视频大模型竞技场的大杀器来了。
作者在火山引擎发布会现场,认为视频生成模型Seedance 1.0 pro最酷。从多镜头组合、运动质量、情绪、运镜、物理动态效果、风格化六个维度测评,该模型各方面表现出色,无明显短板,已开放给企业用户,今日在豆包App全量上线。
11 万 Star 的开源项目,给 AI 编码代理补流程,这套 Superpowers 值得装
110多K Star的开源项目Superpowers,是完整软件开发工作流程,基于17个可组合“技能”。它采用Pull模式,用苏格拉底式追问澄清需求,工作流覆盖多领域,支持多平台,一行命令即可安装。
GitHub 狂揽 12K Star!把 OpenClaw 以及所有 Code Agent 工具装进一个界面!
AionUi是本地优先、开源免费的AI Cowork平台,将散落终端的命令行AI工具统一到图形界面。它兼容主流工具,有统一平台、多工具支持等特点,还具备多任务并行等核心能力,适合多Code Agent用户。
千星项目LLMRouter:多模型路由,16+策略优化推理
UIUC开源智能模型路由框架LLMRouter,可自动为大模型应用选最优模型,有16+路由策略。该框架打通训练、评测等链路,解耦Route与Training模块,支持多轮协同等,还可插件式扩展。
支持持久化知识图谱!多Agent协同的革命性框架
Agent - MCP 是为经验丰富的 AI 开发者设计的多 Agent 协同框架,能解决传统 AI 开发难题。亮点有并行开发、持久化知识图谱和实时可视化协作,可让多 Agent 高效协作,避免上下文丢失和任务冲突。
ICLR 2026 | CineTrans: 首个转场可控的多镜头视频生成模型,打破闭源技术壁垒
随着视频生成模型发展,影视级长视频需多镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。
谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星
今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。