生成式视频」共找到 3022 篇相关文章

算法论文8

AI画手总是六根手指?阿大/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德大学、美团和上海交通大学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
开源动态8

出自小米的模块化图像编辑改造:让 AI 学会「搭积木」

小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进训练,性能优、扩展性好,体现协同智能优势。

AGI Hunt
产品应用8

谷歌发布Nano Banana官方保姆级开发教程,代码给你喂到嘴边

谷歌为Nano Banana新模型发布官方保姆级开发教程。介绍了使用Google AI Studio免费测试方法,阐述环境准备,如获取API key、设置结算账户、安装Gen AI SDK,还展示代码实战,以及和模型沟通的技巧。

AIGC开放社区
开源动态8

MetaGPT 用户智能体发布,开启端到端自主软件测试新范

当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。

特工宇宙
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版有随机出现“极”字的 bug,根源指向 DeepSeek V3.1。此外,Gemini、Grok、Qwen3 等模型也有类似问题。目前对原因有三种猜测,部分被学者否定。

AI前线
开源动态8

完全离线!开源实时语音识别神器,本地实时语音转文字,秒级延迟+说话人识别!

实时语音转文字和说话人识别需求渐长,但传统工具多依赖云端,有隐私与延迟问题。GitHub上的开源项目WhisperLiveKit是本地化语音识别方案,速度快、延迟低、支持说话人识别,适合会议等场景。

开源星探
新闻资讯8

波士顿动力 | 人形机器人Atlas ,最新研究进展!

世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。

AINLPer
新闻资讯7

又是浙大校友!AI眼镜“隔空取物”,戴上即可随心选中现实世界任意物体

混合现实重塑人机交互边界,但传统XR设备选物易出错。研究团队提出Reality Proxy,即现实物体的抽象数字表示,将交互目标转移到代理上,便于用户摆脱限制选物,还支持多种交互功能。

量子位
推荐文章7

人生周报v035:我和你

本周人生周报分享了即刻、X平台上对AI时代产品与服务、人性、社区氛围等观点,推荐《我和你》,还输出对生活、思考、创作等方面感悟,如把一天当一生过、当答案免费问题无价等。

李继刚
产品应用8

腾讯 CodeBuddy IDE 如何成为一个“全栈高级工程师”?

腾讯 CodeBuddy IDE 海外版开启内测,国内版预计 8 月上线。它定位‘下一代 AI 全栈高级工程师’,内置 4 个智能体,助力全链路研发。腾讯内部超 43% 代码由 AI 生成,编码时长缩短 40%。

AI前线