多模型兼容」共找到 9731 篇相关文章

算法论文8

文生图Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在任务上取得显著提升。

机器之心
新闻资讯8

黄仁勋出手!45倍性能暴涨,英伟达定义物理AI新纪元

在SIGGRAPH 2025上,英伟达发布「物理AI」全家桶。展示完整生态,含新硬件、仿真平台和AI模型。如RTX PRO 6000服务器显卡性能涨45倍,还推模型,应用于领域,推动物理AI落地。

新智元
推荐文章7

Harness Engineering?不过是把工程常识换个名字

Chayenne Zhao 发文炮轰 harness 概念,认为它只是工程常识换个名字。她以 SGLang 社区构建智能体系统为例,阐述解决问题的方案和关键决策,还指出真正驱动改进是环境层面,而非模型

AI工程化
开源动态8

在校生开发,榨干 win 系统全部带宽!

介绍在校生开发的开源工具 HypoMux,它面向 Windows,能把张网卡「绑」在一起,让下载任务线路并行。有双模式可选,还能智能分流,兼容主流加速器。操作简便,可解决下载慢问题。

开源先锋
产品应用7

AI+直播的新玩法! StreamDiffusionV2让创意零延迟

生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持GPU并行,可灵活调画质和延迟,实现实时直播。

带你学AI
算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在基准取得 SOTA 性能。

机器之心
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
开源动态8

当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL

随着模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实度为三维度,对 8 款前沿模型测试,揭示 Agent 在步交互微操上的短板。

深度学习自然语言处理
算法论文8

ICML 2026获奖论文揭晓:黄高团队获杰出论文,A3C算法获时间检验奖

ICML 2026公布最佳论文奖项,共10篇获奖,涵盖杰出论文奖、杰出立场论文奖等。此次评选严格,经轮筛选。获奖论文涉及扩散式大语言模型、扩散模型采样算法等个领域。

机器之心
产品应用7

Multi-Agent 的灵活编排之路

文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。

阿里云开发者