医疗视频理解」共找到 1818 篇相关文章

新闻资讯8

Sora 2深夜来袭,OpenAI直接推出App,视频ChatGPT时刻到了

别家节前卷大模型时,OpenAI 悄悄发布 Sora2 并推出 App,还有配套视频推送算法防成瘾。Sora2 在物理准确性等方面优于以往系统,具备同步对话和音效能力,Altman 称是 ChatGPT for creativity 时刻。

机器之心
新闻资讯7

杭州闯出40亿AI医疗IPO!阿里CEO多轮投资

杭州AI陪诊公司微脉准备赴港IPO,其创始人裘加林经验丰富。微脉依托自研CareAI平台,以与公立医院合作为核心开展全病程管理服务,业务增长可观,虽仍亏损但在收窄,此次募资用于AI能力提升和业务扩张。

量子位
开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
开源动态8

4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源

上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。

OpenMMLab
产品应用7

Claude Code 学习最佳实践:NotebookLM 生成全套学习视频+卡片+测试题

文章介绍用NotebookLM学习Claude Code的最佳实践。有人将36篇Claude Code资料“喂”给它,生成含音视频的学习资料库。NotebookLM能多种形式输出,支持多类型输入,值得纳入日常工作流。

AI进修生
开源动态8

阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换

阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。

带你学AI
开源动态8

NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务

华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。

新智元
产品应用8

一手实测全新的Sora 2 - AI视频的ChatGPT时刻到来了。

OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。

数字生命卡兹克
开源动态8

NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!

继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。

开源星探
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元