「播客音频生成」共找到 2414 篇相关文章
如何让LLM的输出更有创造性和随机性?
文章指出让大模型生成随机创造性内容困难,介绍了调整温度和top_k参数等提升LLM创造性和随机性的方法,还提到min_p参数影响及外部引入随机性思路,不过LLM本质有局限,多智能体或可缓解。
字节推出X-Streamer,实时口型同步与长程记忆数字人框架
字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。
当智能醒于物理世界,英伟达副总裁: 下一个十年属于物理AI!|新智元十周年峰会
在新智元十年峰会上,NVIDIA副总裁赖俊杰揭示公司下一个十年战略核心——物理AI,它是继生成式AI和智能体AI后的下一波浪潮。物理AI与现实物理世界交互,但面临诸多挑战,英伟达为此开源Cosmos世界基础模型。
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
最新!Sam Altman:GPT-5几乎所有方面都比我们聪明,准备好直面超级智能
OpenAI的奥特曼在播客中透露GPT - 5已在内部测试,其能力让他有无力感。他认为GPT - 5虽更聪明,但不意味人类价值终结,还提出环球基本财富构想,也坦言对AI影响的担忧。
CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影
3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。
Agent可以自己进化了?!
论文《Automated Design of Agentic Systems》提出让Agent扮演设计师,“元代理”能自动生成新代理设计方案。用编程语言作设计空间,实现“设计自由”。实战中,AI设计的Agent全领域超越人类,还具备知识迁移能力,未来或有自主进化的AI生态。
100个产品原型同时跑、新模型Mythos断层领先,连skills效果都好到让团队意外:Anthropic内部到底在发生什么?
Claude Cowork 工程负责人 Felix Rieseberg 在播客中透露,未发布的新模型 Mythos Preview 带来“断层式跃迁”,在安全漏洞检测等方面表现出色。Anthropic 内部可同时跑上百个产品原型,执行成本降低。还介绍了 Cowork 开发、应用及产品打造经验。
浏览器自动化:从GUI到OpenCLI
文章讲述放弃不稳定的前端UI自动化操作,采用解析并复现底层API请求的方式,来解决浏览器自动化的效率与稳定性难题。介绍了OpenCLI思路、使用方法、原理,还提及自动生成CLI及应用案例,指出未来软件竞争维度将转向可调用性。
4步生图封神,GenEval从61%狂拉到92%,全面超越GPT-4o的TDM-R1模型来了
香港科技大学唐靖团队等提出全新通用强化学习框架 TDM - R1,仅 4 步采样就让组合式生成指标 GenEval 从 61% 升至 92%,超越 GPT - 4o。它解决少步扩散模型痛点,实现多方面性能提升,为少步生图发展带来新方向。