「多模态代码生成」共找到 4209 篇相关文章
2025 年的 Vibe Coding 思考|Reflections on Vibe Coding in 2025
作者基于自身经历和观察分享 2025 年 Vibe Coding 思考。指出创作应从喜好和用户需求出发,与用户紧密相连,还对 2026 年模型发展、产品方向等做了预判,探讨了实现人人 Vibe 还缺的条件。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
云计算“活教科书”语出惊人,指明程序员的进化方向
亚马逊云科技副总裁Jeff Barr被称云计算“活教科书”。他认为AI编程工具放大开发者技能,开发者应提升沟通能力,未来“短命应用”将涌现,云与AI结合是趋势,还见证了中国云计算发展的巨大进步。
一手实测全新的Sora 2 - AI视频的ChatGPT时刻到来了。
OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。
昨日,AI内容新规正式实施,这次不注意是真的会违法。
9月1日,《人工智能生成合成内容标识办法》及配套国标正式执行。新规规定AI模型或应用提供方要给生成内容打“显式”与“隐式”标识,对产品创业者、AI工具提供方和创作者等提出不同要求。
刚刚,智源全新「悟界」系列大模型炸场!AI第一次真正「看见」宏观-微观双宇宙
6月6日第七届智源大会,智源研究院推出全新「悟界」系列大模型,含原生多模态世界模型Emu3、脑科学多模态通用基础模型见微Brainμ等,反映其对大模型发展的研判,推动AI向物理世界迈进。
蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。
蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。
Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”
来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。
马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?
马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。
GitHub热搜,腾讯黑科技炸场!PhotoMaker:10秒定制真人级头像,百万开发者已疯狂
PhotoMaker是腾讯ARC实验室联合南开大学发布的人像图像生成项目,荣膺CVPR 2024。它能秒级生成高质量人像,有高保真ID嵌入等机制,V2版升级显著,适用多场景,比同类项目优势明显。