「T2V技术」共找到 4434 篇相关文章
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。
理解、生成、编辑一次搞定:Skywork UniPic 2.0的统一多模态解法|甲子光年
电商团队常面临创作流程繁琐问题,当前行业需统一架构。昆仑万维发布Skywork UniPic 2.0,整合理解、生成、编辑功能。它参数小性能优,还构建奖励模型,配合其他模型构建体系,具成本等优势。
Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!
全球最快开源大模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。
「10万小时人类数据」不搞对齐只靠规模,灵初智能Psi-R2登顶MolmoSpaces!
4月10日晚,灵初智能发布大模型、数据集与合作计划,包括策略模型Psi - R2、世界模型Psi - W0及近10万小时人类操作数据。其未走花哨对齐路线,靠系统协同,在MolmoSpaces评测中表现优异,体现自主研发路线先进性。
谷歌Gemini 3.2偷跑上线!2200行代码一镜到底,Claude/GPT坐不住了
发布会未开,谷歌Gemini 3.2 Flash网页端静默上线,编码实力强悍,代码量大幅提升。其核心技术是蒸馏与稀疏化,推理成本大降。Gemini App集成第三方应用,谷歌I/O大会多款产品将曝光,此次发布对谷歌至关重要。
扒光谷歌Gemini 2.5:一份官方“翻车报告”,揭露AI Agent的8个秘密。
谷歌DeepMind发布Gemini 2.5技术报告,以玩《宝可梦 红/蓝》为例,展示构建有效智能体的案例。该系统架构由多部分组成,但运行状况百出,如上下文过长变差、产生幻觉等,也有亮点,还能提炼避坑方法。
VLA爆发!从美国RT-2到中国FiS-VLA,机器人「即知即行」的终极进化
2025年具身智能爆火,VLA模型成核心。从美国RT - 2到中国FiS - VLA,VLA硬核进化。谷歌、微软等有重要成果,中国智平方等企业也不断创新,FiS - VLA性能超现有方法,VLA正重塑机器人与人类交互未来。
首个MCP架构、只50行代码就能实现高效RAG的开源框架UltraRAG 2.0
检索增强生成系统(RAG)复杂度提升,使科研人员面临高昂工程实现成本。清华大学、东北大学、OpenBMB等联合推出UltraRAG 2.0,基于MCP架构,降低技术门槛与学习成本,让科研专注创新。
linux.do:一个被严重低估的中文技术社区,国内懂的人都在偷偷用
本文介绍了中文技术社区 linux.do,它上线两年多,虽访问量已追上老牌社区 V2EX,但很多人不知其存在。其核心围绕 ChatGPT 和大模型,有一手信息、开源协作氛围和活跃管理团队,还给出注册及避坑建议。
LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代
Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。