「医疗视频理解」共找到 1818 篇相关文章
用了飞书aily新功能,我终于理解什么叫“AI不是聊天,是干活”
作者黄叔体验飞书 aily 工作助手的“任务模式”后赞不绝口。该模式能异步工作、深度结合飞书生态,可像数字员工一样交付多种成果,如竞品报告、网页、海报、播客等,虽有不足但非常实用。
GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣
第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。
从 LLM 到 World Model:为什么我们需要能理解并操作世界的空间智能?
文章指出 LLM 仅靠语言不足以支撑真正智能,构建空间智能与世界模型成关键方向。2024 年李飞飞等创立 World Labs,11 月推出 3D 世界生成模型 Marble,本文探讨空间智能重要性及世界模型如何成转变基础设施。
刚刚,Top级的视频AI免费了!我反手做了个精致版《牛来》
明星AI实验室Agnes发布的Agnes Video 2.5系列已上线Pavo创作平台。其中,Agnes Video 2.5 Flash免费,适合AI短剧创作者;Agnes Video 2.5每天送积分,适合商业场景。实测显示其效果佳,免费还能大胆试错。
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。
中学生就能看懂:从零开始理解LLM内部原理【十二】|位置嵌入 - 给模型装上"GPS"
文章指出Transformer对词顺序不敏感,引出位置嵌入概念。介绍经典的函数编码、可学习位置嵌入法及新主流RoPE,还提及为让模型处理长文本,在RoPE基础上用PI和YaRN等扩窗技巧。
医疗AI迎来大考!南洋理工发布首个LLM电子病历处理评测 | AAAI'26
南洋理工大学研究人员构建EHRStruct基准,涵盖11项核心任务、2200个样本,用于评测LLM处理结构化电子病历的能力。研究发现通用大模型优于医学专用模型,提出的EHRMaster框架与Gemini联合后性能超现有模型。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
机器人“狂踹不倒”视频刷屏!太空舱遍布城市街巷,银河通用这几手秀麻了
银河通用发布全新通用动作追踪框架Any2Track,让机器人精确模仿人类动作,还能抗干扰。团队将动作捕捉学习解耦为两阶段,兼顾精准模仿与抗干扰。其银河太空舱让机器人融入生活,全栈自研技术推动具身智能落地。
全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式
北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。