「原生多模态架构」共找到 2940 篇相关文章
把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流
本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频转为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。
突破视觉仿真算力瓶颈!新一代具身智能仿真框架开源:高吞吐并行高保真渲染助力规模化训练
具身人工智能向以视觉为中心转型,但面临“看得真”和“训得快”难题。清华大学智能产业研究院等提出GS - Playground通用多模态仿真框架,融合高吞吐量并行物理仿真与高保真视觉渲染,成果被RSS 2026录用,将开源。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。
Moxt 实测:把你的组织,折叠进一堆文件夹
作者实测 Moxt 后发现,它能解决 AI 产品上下文散且脏的问题,提供工作空间,让 AI 在原生格式工作;用户可创建专属 AI,还能精简 Context。此外,它支持技能组合、定时任务等,输出拓展到视觉形态。
浅析 Amazon S3 Files:工作机制、性能边界与选型思路
4月7日,AWS发布新服务Amazon S3 Files,可将S3存储桶作为高性能共享文件系统挂载到计算节点。本文分析其底层实现、工作机制、性能边界,与其他对象存储文件化方案对比,指出适用场景。
实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】
本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义层。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。
国内首个!加入六维力的全感知数采,让VLA模型进化出力触觉
具身智能发展受数据采集制约,开普勒机器人发布国内首个原生全感知力触数采系统,打通全链路闭环。该系统具平台化特征,让具身智能范式转变,还获融资并升级战略,在工业场景表现出色。
港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026
香港中文大学薛天帆团队提出CubeComposer框架,可将普通视角视频扩展成原生4K的360°视频。研究在两个数据集测试,结果显示其在多指标上优于基线。该成果突破技术上限,让普通人也能制作360°视频。
不拼GPU!中兴扔出AI超节点,把token价格打下来
在万亿级大模型时代,传统‘芯片堆砌’方式面临通信开销剧增等痛点。中兴通讯推出超节点技术,从系统级协同架构出发,通过六大维度创新,绕开单GPU芯片瓶颈,重构AI算力基础设施,推动行业向开放、融合发展。
大模型记忆系统 MemOS 2.0:StarDust 技术演进与关键挑战|QCon 北京
4月16 - 18日QCon北京大会聚焦Agentic AI等前沿话题,记忆张量CTO李志宇将分享《大模型记忆系统MemOS 2.0:StarDust技术演进与关键挑战》,梳理技术演进,推出MemOS 2.0 StarDust,还分析实践痛点与演讲亮点。