「世界创作」共找到 1261 篇相关文章
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。
骗过所有人!这首燃炸了的「女团神曲」,竟是AI直出
2026开年,AI冲击艺术领域。昆仑天工的Mureka V8改写AI音乐规则,超越Suno V5,跨越“像音乐”到“是音乐”的鸿沟。它引入MusiCoT技术,还配套Studio、API等,定义“好的AI音乐”新品类。
比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎
谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。
52KB 的奇迹!NovaSR 开源:16kHz 秒变 48kHz,快出天际的音频超分模型!
在AI“巨物崇拜”盛行时,NovaSR开源带来“微型震撼”。它仅52KB,能将16kHz音频提至48kHz,单张A100达3600倍实时。可端侧运行,效率提升显著,有诸多应用场景。
Langchain回应OpenAI:为什么我们不做拖拉拽工作流
OpenAI发布可视化工作流构建器AgentKit,LangChain创始人Harrison Chase写文解释为何不做。他指出工作流与智能体不同,可视化工作流构建器有门槛高、难管理等问题,还给出不同复杂度问题的解决方案。
节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世
国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。
新颖的人形机器人训练框架
Robot - Trains - Robot (RTR)是新颖框架,机械臂教师支持引导人形机器人学生。它能以最少人工干预实现高效长期真实世界人形机器人训练,文中还介绍安装设置、使用指南等内容。
人类击败OpenAI守住编程冠军!10小时激战两次反超,AI最后关头功亏一篑
在AtCoder世界巡回总决赛编程赛中,OpenAI的OpenAI - AHC前期领先,后半程失误,人类选手Psycho两次反超夺冠。Psycho曾在OpenAI训练AI战胜人类,此次挑战老东家获胜。
Lovart的开源平替产品,完全本地免费的AI设计Agent。
Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能。