「多模态技术」共找到 3529 篇相关文章
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。
当人形机器人还在画饼,这家公司已用“带大脑的机械臂”实现批量落地 | 甲子光年
当资本热捧人形机器人时,微亿智造已率先将工业具身智能规模化落地。其‘创TRON’机器人解决多行业痛点,实现降本增效,落地版图不断扩大,还构建技术护城河,未来将迈向群体智能。
英伟达发布 Jet-Nemotron 系列小模型,理论最大加速比 56 倍
英伟达发布 Jet - Nemotron 系列小模型,在多项基准测试中表现出色,实现高吞吐量加速和高准确率。其训练采用 PostNAS 方案,对既有模型针对性优化,展示了在小模型优化上的可行技术路径。
四问智谱上市|甲子光年
2026年1月8日,智谱AI在港交所上市。本文围绕其上市提出四问:是否为“中国OpenAI”、投资人押注点、商业模式健康度及“钱路”方向。指出它应卸下标签,回归技术与商业本质。
AI Coding正在重塑大前端!一码多端如何破局?
InfoQ直播栏目邀前阿里工程师吴子奇等探讨AI Coding与跨端研发。提到跨端框架设计、技术创新、人才要求等观点,还介绍快手和字节探索,10月QCon上海站设相关专题。
最好的 DeepResearch 平替开源了
ROMA是元代理框架,以递归分层结构解决复杂问题,有并行问题解决、透明开发等优势。它通过计划 - 执行循环处理任务,介绍了安装选项、技术栈,还有预构建代理展示功能。
斩获20K星!再见PDF排版噩梦,这个开源神器让文档处理爽到飞起!
MinerU是上海人工智能实验室推出的开源数据提取工具,能将多模态文档解析为Markdown,支持精准提取图片、表格、公式,具有多语言支持、高性能等特点,应用场景广泛,还开源免费。
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。
面向 AI Agents 的高性能数据基座:架构和工程实践
在 QCon 全球软件开发大会上,晨章数据创始人陈亮分享了面向 AI Agents 的高性能数据基座。他指出 AI Agent 驱动的应用带来数据挑战,提出多模态数据基座设计目标,并介绍工程实践,证明传统架构有 CPU 瓶颈。
AI基础架构重大突破,计算成本暴降38倍
Perforated AI团队搞出‘穿孔反向传播’技术,给旧神经元加‘人工树突’。测试中计算成本最高降38倍,模型准确率不降反升,还近乎即插即用。这或引发行业变革,但也面临验证、生态和收费等挑战。