可控生成技术」共找到 4770 篇相关文章

新闻资讯8

AI Coding大佬聊透了:产品智能重要还是用户体验重要?答案让人意外

量子位举办AI Coding沙龙,百度、硅心科技等多位行业玩家参与。探讨AI编程从替代人转向协作、智能体发展、To B与To C界限模糊等话题,指出未来产品智能更重要,编程产品将服务更广人群,程序员技能需转变。

量子位
产品应用8

6秒造一个「视频博主」,Pika让一切图片开口说话

8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。

机器之心
产品应用7

字节推出全新视频换装框架DreamVVT

视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。

带你学AI
算法论文8

让AI读懂「言外之意」:AI4SG团队发布首个心理健康污名语料库,破解隐性偏见识别难题

心理健康患者常面临社会偏见,且这种污名化隐蔽难识别。新加坡国立大学AI4SG团队联合多学科专家,构建首个心理健康污名访谈语料库MHStigmaInterview,获ACL 2025认可,为解决该社会问题提供技术支持。

机器之心
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
开源动态8

一句话复刻谷歌!我用智谱新开源的GLM-4.5,把Agent开发打回了简单模式。

智谱AI深夜发布开源的新一代旗舰模型GLM - 4.5,目标成为最强Agent基座。它能一句话复刻搜索引擎,多能力原生融合,在多项测试中表现出色,推理快、价格低,还通过多关压力测试,且开源成本低。

探索AGI
新闻资讯8

一个月重写三次代码库、三个月就换套写法!吴恩达:AI创业拼的是速度,代码不重要

吴恩达在 Y Combinator 演讲分享创业心得,指出执行速度是创业成败关键,创业者最大机会在应用层,介绍提速方法,还回应 AGI 炒作、token 成本等问题。

AI前线
8

DeepMind夺得IMO官方「唯一」金牌,却成为OpenAI大型社死现场

谷歌DeepMind宣布其Gemini进阶版模型在IMO竞赛达金牌水平,解决五道超高难度试题,首次证明AI仅靠自然语言理解就能攻克复杂数学难题。其谨慎发布方式获赞誉,与OpenAI形成鲜明对比。

机器之心
推荐文章7

Qwen2.5VL新玩法,看电影讲故事

本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。

CourseAI
算法论文8

ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI

上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。

机器之心