「代码生成代理」共找到 3663 篇相关文章
ICML 2025 Spotlight | 用傅里叶分解探讨图像对抗扰动,代码已开源
文章聚焦图像对抗净化,现有基于扩散模型策略在时域难解耦干净像素与扰动,损害图像语义。作者从频域研究,用傅里叶分解,发现扰动倾向破坏高频谱,提出注入低频信息,效果显著,论文与代码已开源。
Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法
阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式
随着AI生图能力提升,如何让AI进入创作流程成新问题。兔展智能基于UniWorld - Design视觉AI大模型推出RabbitVis,推动视觉AI从图片生成走向可编辑、可交付的创作流程,解决创作流程断点问题。
视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源
腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。
5行代码,逼疯整个硅谷!澳洲放羊大叔,捅开AI编程奇点
澳大利亚养羊大叔Geoffrey Huntley的5行代码Ralph-Wiggum循环震动硅谷。它让Claude Code和Cowork发展,开发者用其屡创佳绩。该技术强调失败价值,虽有局限,但预示软件开发行业深层转型。
Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库
Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。
OpenAI编程新王GPT-5-Codex发布,7 小时搞定复杂代码,准确率飙升
OpenAI发布编程系统GPT - 5 - Codex,它是GPT - 5针对Codex产品的升级。能独立处理复杂编程任务,在性能、代码审查、前端开发等方面表现出色,还有严密安全体系,驱动Codex产品生态升级。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
Cursor团队把内部开发流程打包成插件:18个技能+2个规则+1个代理
Cursor团队将内部工作流打包成插件,即插即用,无需第三方服务集成。套件含18个技能、2个规则和1个代理,可通过`/add-plugin cursor-team-kit`安装,插件地址为https://cursor.com/marketplace/cursor/cursor-team-kit。
Google Nano Banana 与 GPT-4o Image 1:哪款 AI 图像生成更好?
2025年8月26日,Nano Banana发布引关注,而GPT - 4o Image 1是主流常用图像生成器。文章从关键指标、生成速度对比二者,又用相同提示词在多种场景对比,分析各有优劣,适用场景不同。