「多任务统一输出」共找到 2560 篇相关文章
源神阿里!图像生成Ovis-Image再开源,7B小参数媲美GPT-4o和20B开源模型
阿里Ovis团队发布Ovis - Image,7B参数文本到图像模型,在文本渲染任务媲美GPT - 4o和20B + 开源模型。它架构优化、数据工程精细、训练范式独特,实测数据表现佳,显存占用低、推理快。
自定义轨迹驱动AI视频生成,ATI无需训练适配多种生成模型
字节提出视频生成运动控制统一框架ATI,通过轻量级运动注入器将用户定义轨迹投影至预训练图像 - 视频生成模型潜在空间,实现协调控制。用户指定关键点及路径控制运动,无需重新训练,适配不同架构。
超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。
AI 创作继续:Google 推出Pomelli,一款能读懂你网站气质的 AI 营销设计师
Google Labs推出AI营销工具Pomelli,可帮中小企业几分钟内创建符合品牌的社交媒体活动。流程为给其网站,它建立品牌“商业DNA”,生成活动创意和资产,用户编辑调整即可。输出仅支持英文,出海网站可尝试。
Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」
Vibe Coding虽降低开发门槛,但Coding Agent处理复杂任务易失控。当前Agent缺乏工程状态层隔离控制,Valkor等联合开源loom,它将交付拆解成状态链,过滤噪音,为大模型落地提供状态基建。
成功率最高暴跌36.9%!南洋理工首个“模糊指令”测试,直击具身智能落地软肋
南洋理工大学MARS Lab团队联合发布测试基准REI-Bench,量化现有具身智能大模型缺陷。在其测试下,主流任务成功率最高降36.9%。研究还剖析错误原因,给出解法,望引起学界重视。
终于学会“复盘”了!让智能体从“解题”进化到“进化”!
上海AI Lab和新加坡国立大学推出新框架RETROAGENT,让AI Agent学会“复盘”。它通过双重内在反馈复盘,提出SimUtil - UCB策略查记忆,在多项任务中碾压基线模型,使Agent从解题进化到进化。
豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!
传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。
Claude Code 的创始人揭秘工作流程:开 5 个智能体“玩编程游戏”,不看的程序员就落后了?
Anthropic公司Claude Code创始人Boris Cherny在社交平台分享工作流程,引发行业关注。他并行运行5个Claude智能体编程,用最大最慢模型Opus 4.5,还解决AI“健忘症”,实现重复性任务自动化。
微软又搞大新闻:GitHub Copilot 开源,VS Code 要变天了。
微软官宣将把 GitHub Copilot Chat 扩展代码开源,重构相关组件到 VS Code 核心,使其成开源 AI 编辑器。还推出 Coding Agent,能自动化处理多种开发任务,目前在 Copilot Pro Plus 版本预览。