音乐生成」共找到 2252 篇相关文章

开源动态7

新玩法!Karpathy周末手搓“大模型智囊团”应用:各大LLM同台互评,代码已开源

Andrej Karpathy周末手搓Web应用llm - council,让多个大模型像顾问般提供建议。查询通过OpenRouter分发给多个大模型,它们互评后由‘大模型主席’生成最终回复,代码已开源。

AI寒武纪
新闻资讯8

李飞飞最新长文:AI的下一个十年——构建真正具备空间智能的机器

李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》,解读空间智能,阐述构建具备空间智能机器的核心框架,探讨其应用场景,认为这是AI下一个前沿。

机器之心
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
新闻资讯7

刚刚,英伟达拟10亿美元砸向这家AI编码创企!Copilot 技术大佬带队、成立两年估值近千亿

10月30日消息,英伟达拟向AI初创公司Poolside投资最高10亿美元。该公司由微软技术大佬带队,定位生成式AI与软件开发交叉领域,开发自研模型,有独特强化学习方法和技术布局。

InfoQ
开源动态7

国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~

近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。

PaperAgent
开源动态8

SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster

香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。

机器之心
新闻资讯7

前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA

Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。

AIGC开放社区
算法论文8

AI画手总是六根手指?阿大/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德大学、美团和上海交通大学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
推荐文章8

从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略

大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。

AI大模型应用实践
新闻资讯8

来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!

OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。

新智元