「3D世界模型2.0」共找到 9010 篇相关文章
童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了
Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。
拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景
昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。
Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死
当Ilya断言大模型未来在于架构创新时,中国团队推出全球首个可大规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。
北大 & 作业帮团队提出 Text-to-SQL 新框架 Interactive-T2S,攻克宽表处理与低资源对齐难题
北大与作业帮联合研发的论文提出 Interactive-T2S 框架,将 LLM 塑造成智能代理,通过多轮交互解决传统 Text-to-SQL 方法在宽表处理、低资源对齐等方面的难题,已入选国际顶会 CIKM2025。
美团重磅开源!13.6B通用视频生成大模型,能文生视频、图生视频、还能续写!
AI视频生成竞争激烈,美团团队在GitHub开源通用视频生成模型LongCat-Video,参数量13.6B,能文生视频、图生视频、视频续写,几分钟生成720p、30fps长视频,有核心优势,还介绍了安装部署等内容。
24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙
虎牙推出实时多模态数字人VAM 1.0,只需一张照片就能转化成能说会唱、可实时互动的数字人。它解决了AI数字人行业的时间、交互、部署三堵墙,稳定性、交互精度和响应速度表现出色,应用场景广泛。
模型训练最重要的依然是 Scaling —— 对话阿里通义千问 Qwen 多语言负责人杨宝嵩 | Open AGI Forum
本文是对阿里通义千问Qwen多语言负责人杨宝嵩的专访。他透露Qwen一开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到多语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。
10人创业团干翻行业“潜规则”!全员必须会AI、让跑大模型全程“裸奔”,谷歌老兵不烧钱创业
在AI创业浪潮中,谷歌老兵Bryan Zhou带领10人团队创立AnyInt平台。该平台定位AI Infra中间件,一个API对接所有模型,提倡“去中心化”,让用户付费,还在工程、安全等多方面优化,吸引开发者付费。
一次汇报,资源投入暴涨数十倍:快手大模型推荐以 1/12 成本突围,技术负责人亲历的革新故事
InfoQ 专访快手科技副总裁周国睿,他分享了快手大模型推荐技术投入挑战、决策过程等。如汇报后资源投入涨数十倍,以 1/12 成本突围。还阐述推荐系统变革、技术押注及未来推荐系统突破点等观点。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。