视频大模型」共找到 9468 篇相关文章

产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图

火山引擎原动力会发布豆包模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元
开源动态8

小米的首代机器人VLA模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源

具身机器人成科技新热点,家期待其释放生产力。小米首代具身VLA模型Xiaomi - Robotics - 0抓间歇停顿问题,4.7B参数规模下推理延迟仅80ms,还做三项技术创新,且全面开源。

量子位
算法论文8

喂给AI的Skill正让它变笨!清华团队发现模型经验复用的黄金法则

清华学与EvoMap团队研究发现,给模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。

AIGC开放社区
新闻资讯8

模型收入暴涨1076%,港股AGI第一股首份年报:一年狂揽12亿,属实把商业化玩明白了

港股AGI第一股云知声披露首份年报,全年营收12亿,模型业务收入暴涨1076%成核心增长引擎。其靠“强基模、深应用”战略实现业绩增长,还计划拓展MaaS模式,探索多元“第二曲线”。

量子位
开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。

DeepTech深科技
算法论文8

Qwen&清华团队颠覆常识:模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
开源动态8

MiniMax-M1:全球首个开源超长上下文模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
产品应用8

模型API的众点评来了:7×24小时实测,毫秒级延迟智能路由,选API必备

清程极智推出的AI Ping像模型API领域的众点评,用7×24小时实测数据为开发者提供参考,解决信息差和重复劳动问题。它有持续评测榜单、智能路由匹配等功能,还统一了API度量衡,推动选型从经验走向数据驱动。

量子位
推荐文章7

我用模型砌“屎山雕花”:5天肝出几万行代码!产品经理的AI编程翻车记

作者作为非技术背景的产品经理,分享用模型编程经历。先借 MCP 搭建应用,后 5 天产出量代码却问题多。经三次重构领悟协作方法,还总结沟通技巧,指出 AI 编程改变产品经理工作,未来需融合多角色能力。

InfoQ
产品应用7

童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了

Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。

机器之心