「多模态代码生成」共找到 4161 篇相关文章
303页年度最佳AI Code综述:阿里、字节、快手30家顶级机构出品
分享303页《从代码基础模型到智能体与应用:代码智能实践指南》,由近30家顶尖机构出品。介绍2021 - 2025年代码大型语言模型发展,分析通用与代码专用LLM能力,阐明研究 - 实践差距,还开展实验。
记一次cursor编程代码修复的过程
作者分享用Cursor编程时遇到代码bug的修复过程。Cursor写的代码运行报错,自我修复及借助千问、DeepSeek都无果,最后靠谷歌找到解决办法,还提醒要降低对Cursor的依赖。
Sora终于开放上传真人照片生成视频了
本周起,符合条件的Sora用户可上传含人物照片制作视频,使用前需声明获人物同意。这是Sora受期待功能之一,有严格限制,且照片转视频功能审查更严,此为OpenAI平衡之举。
一张俯视图,竟然能生成完整3D小镇?
获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。
教程 | 如何做出 X 上爆火的 AI 蓝图动画
作者受X上爆火的Midjourney风格代码启发,分享恐龙主题短片制作方法。介绍风格代码功能,还讲了控制画面配色技巧,最后给出复杂动画prompt示例,推荐找风格代码的作者和网站。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。
效果逼真到让人窒息!开源Ctrl-Crash模拟车辆事故
近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash可控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。
所谓“氛围编程”,不过是“技术债”的新马甲
本文编译自 Steve Krouse 演讲与博客,指出‘氛围编程’代码即遗留代码、‘技术债’,编程核心是理论构建。还认为工具优于智能体,代码是描述软件的正确媒介,人类大脑在编程中始终是核心。
氛围编程行不通!CTO们集体炮轰AI编程:不是失业,而是失控
CTO们认为氛围编程是灾难,如代码上线后出现系统崩溃、用户权限漏洞等问题。Augment Code的Chris Kelly演讲指出,AI写代码有局限,软件工程师要做决策,还给出写让AI接手代码的建议。
谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了
谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。