「多任务能力」共找到 7386 篇相关文章
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。
搅局者来了!智谱重磅开源AutoGLM,让“豆包手机”人人可造!官方:AI手机不该掌握在少数厂商手中
智谱团队将核心AI Agent模型AutoGLM完整开源,它有手机操作能力,支持上百主流APP。智谱认为AI手机是趋势,不应被少数厂商垄断,开源还能解决隐私问题,复用技术经验。
刚上市的摩尔线程,即将揭晓新一代GPU架构
2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。大会聚焦国产全功能GPU,主论坛将揭晓新一代GPU架构,还有超20场技术分论坛及1000㎡科技嘉年华,诚邀各方共筑智能计算生态。
从分钟级等待到20倍超速:LightX2V重写AI视频生成速度上限
今年,开源项目LightX2V在ComfyUI社区走红,单月下载超170万次。它是面向低成本、强实时视频生成的推理技术栈,能在消费级显卡上高效生成视频,还支持多种模型和硬件,覆盖不同用户需求。
字节即梦张楠:帮人类提升创造力,才是更有意义的「目标函数」
在极客公园IF 2026创新大会上,张鹏与字节跳动即梦张楠探讨人与AI等内容。还放映AI短片《老妈的心愿》,全程由AI创作。张楠介绍合作计划,谈及创作挑战、AI与人关系、Sora与抖音差异等内容。
多模态思维链如何重塑 AI 与短视频的未来
传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。
从补全到 Agentic Edit:Trae 在代码编辑上的落地与进化
AI 编程助手走向智能化,Trae 团队历经“补全 + Chat → Apply → Builder + Cue”三阶段,解决文件定位、跨文件修改等难题,介绍 Apply 与 Search/Replace 方案适用场景,还将从三方面继续探索。
MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV
上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。
国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源
上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。
奥特曼想要一个「AI接班人」!劈柴:这一天会来的
近日,奥特曼自曝「AI接班人」计划,认为AI近年能胜任OpenAI部门管理,最终覆盖企业流程。OpenAI企业客户破百万,其构想或为盈利拼图。但目前AI难取代CEO,奥特曼若被取代就去当农民。