「3D视频世界模型」共找到 8328 篇相关文章
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日,腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行,适用于低功耗场景。模型具备推理快、性价比高特点,亮点是Agent和长文能力,已在腾讯多业务应用。
卷不赢模型,Meta改行「算力包租公」!一夜炸崩美股AI链
Meta筹建「Meta Compute」云业务,出售AI算力和模型访问权限,冲击云计算格局。此前Meta为AI砸巨资,模型需求不火,效仿SpaceX出租算力。它有两张牌,还由重量级班子操盘。
最新视觉大模型 DINOv3论文精读(逐段解析)
DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。
14K Star!统御万模的 AI 聚合网关,一个 API 管理所有大模型!
文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。
豆包上了视频通话后,我妈再也不用攒着问题等我回家了。
豆包上线视频通话功能,作者第一时间告知妈妈使用。妈妈借助豆包解决了重置手机、识别花等问题,还帮外婆安装。视频通话互动陪伴感强,降低使用门槛,让亲人享受科技温暖。
Hugging Face 推出 GOLD:让不同模型家族也能做知识蒸馏
Hugging Face研究团队提出GOLD方法,解决了知识蒸馏中老师和学生模型需用同一套分词器的痛点,让不同模型家族间也能做知识蒸馏。它通过三步解决跨分词器蒸馏,实验效果良好,已集成到TRL库。
SpAItial发布超逼真3D空间基础模型
德国AI初创平台SpAItial获1300万美元种子轮融资,发布超逼真3D基础模型。其核心技术能理解3D世界,可基于文本或图片生成3D场景,在多领域有革新可能,虽有竞争,但未来有望推动AI三维突破。
让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了
近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。
大模型竞赛转向:决胜关键为何是“后训练”?|甲子光年
大模型价值主战场向后训练转移,Grok 4凭后训练成“宇宙最强”。产业应用中通用模型适配难,后训练方法也在进化,如采用SFT+RL等,还介绍了夸克和阿里云的后训练实践。
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。