生成任务」共找到 3869 篇相关文章

算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
开源动态8

带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具

港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。

量子位
新闻资讯7

马斯克说今年编程就要死了,你信吗?

近期一条推文称马斯克预言编程今年将消亡,引发热议。但实际是作者二次创作,马斯克只是即兴推测年底或不用写代码。‘AI 直接生成二进制’有跨平台、可审查、可靠性三个问题,编程更可能走向‘AI写、人审’。

宝玉AI
开源动态8

Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍

Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。

AIGC开放社区
开源动态8

GitHub连续霸榜,难怪别人的图表这么高级优雅!

作者让AI画系统架构图效果不佳,朋友推荐diagram-design项目。它是给Agent用的出图技能包,能让AI生成编辑级质量图表,有多种图表类型,具备诸多亮点功能,还介绍了安装使用方法。

开源先锋
算法论文8

ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

现有视频虚拟试衣方法受限于固定相机视角,难以满足用户自由观察需求。本文提出 TryOnCrafter 框架,定义可控相机视频虚拟试衣任务,引入可渲染 4D 试衣代理,支持多种下游应用,为虚拟试衣开辟新路径。

机器之心
产品应用7

劝视频博主别拿龙虾起号,7×24小时全自动,碳基生物真卷不过

X上网友分享的AIVideo Agent可7×24小时全自动完成视频制作流程,上手无技术难度,还能与多平台集成。AIVideo.com功能全,实测生成速度快且操作空间大,或改写传统视频生产流程。

量子位
新闻资讯8

LangChain 创始人警告:2026 成为“Agent 工程”分水岭,传统软件公司的生存考验开始了

LangChain 创始人 Harrison Chase 认为 2025 年末到 2026 年长任务 Agent 落地会加速,传统软件公司面临挑战。他指出构建 Agent 工程范式在变,还分享了 Agent 应用案例、harness 工程要点、开发与传统软件的差异等内容。

InfoQ
开源动态8

蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了

蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据集,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。

机器之心
产品应用8

别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务

AI产品黄叔