「生成模型规模」共找到 8950 篇相关文章
劈柴哥玩得上头!Nano Banana Pro 真杀疯了,但谷歌没接住用户的付费热情?
谷歌推出新图像生成与编辑模型 Nano Banana Pro,它基于 Gemini 3 Pro,能力提升,获大量好评。不过付费流程繁琐遭吐槽。此外,谷歌 CEO 回应了 AI 泡沫、岗位影响等问题。
8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布
字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。
The Batch: 973|Claude 的水印如何运作
Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
首发丨手机的『魔法挂件』,实测钉钉dingtalk A1,有用的好帮手
2025年基于大模型的AI硬件焕发生机,钉钉dingtalk A1是其中代表。它厚度仅3.8mm,使用方便,具备会议录音转写、纪要生成、通话分析等功能,还能用于学习和生活场景。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%
最近华为在MoE训练系统给出算子和内存优化新方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍。
CVPR2025|MCA-Ctrl:多方协同注意力控制助力AIGC时代图像精准定制化
中国科学院计算技术研究所团队提出无需微调的通用图像定制方法 MCA - Ctrl,利用扩散模型内部知识,结合条件语义与主体内容。实验显示其在编辑和生成任务表现优,解决了现有技术瓶颈。
AI「看不懂」、「做不好」视频的问题,混元用「MTSS」解决了
腾讯混元团队提出 Multi-Stream Scene Script(MTSS)新视频描述范式,将传统方式升级为‘多流结构化剧本’。它解决了传统方式语义冗余、扩展性差等问题,在视频理解和生成任务表现显著。
从实践到原则:为 AI Agent 构建的 Harness Engineering 落地与探索
生成式 AI 进入软件开发核心流程,但 AI 写代码速度超团队控复杂度能力。问题不在模型,而在软件工程系统。Harness Engineering 试图解决此问题,从三层面重新设计工程系统,已有公司实践。