医疗视频理解」共找到 1821 篇相关文章

新闻资讯7

Elad Gil:AI 应用进入收敛期,比模型跑得快才能抓住红利

硅谷AI投资人Elad Gil回顾AI领域投资,指出AI应用进入收敛期。基础模型头部梯队明显,格局难改;GPT-ladder带来新机会;应用端理解痛点、构建工作流的团队更有优势,AI Agent重塑商业模式。

Founder Park
产品应用7

“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影

约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。

带你学AI
开源动态7

Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了

开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。

量子位
8

DeepMind夺得IMO官方「唯一」金牌,却成为OpenAI大型社死现场

谷歌DeepMind宣布其Gemini进阶版模型在IMO竞赛达金牌水平,解决五道超高难度试题,首次证明AI仅靠自然语言理解就能攻克复杂数学难题。其谨慎发布方式获赞誉,与OpenAI形成鲜明对比。

机器之心
产品应用8

深谋科技重磅发布真正为人类服务的新一代人形机器人核心技术「声波传感 · 意念控制 · 高精视觉 · 类脑智能」

深谋科技将在2025 WAIC展示陆上具身智能人形“美猴王”和空中具身智能巨兽“星汉一号”,并发布新一代人形机器人核心技术,包括传感、脑机交互等系统,构建具身智能全域系统闭环。

AI科技评论
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
推荐文章7

从Rax+DX到React,一次跨端组件重写的AI提效探索

本文基于M站首页重构项目,讲述借助AI编程工具Cursor和结构化Prompt,完成从Rax到React的组件迁移、DX到React的跨端重写,实现业务逻辑优化与工程规范落地,还分析了AI提效的优劣并总结迁移范式。

阿里云开发者
产品应用7

夸克高考,背后藏着的其实是垂类场景「深度研究」方法论

夸克早在2019年就提供高考志愿填报服务,今年推出“志愿报告”功能。其“志愿报告”Agent已生成超1000万份报告,采用PDCA模式给出指导。夸克构建可信度体现在数据库和自研模型上,还降低了幻觉率。

特工宇宙
开源动态7

香港科技大学、Manycor开源空间大模型,超3000颗星

香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。

AIGC开放社区
开源动态7

谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜

昨天谷歌发布免费开源的AI Agent Gemini CLI,可在电脑终端运行。它定位为开源AI Agent,能理解任务、制定计划和调用工具。免费额度慷慨,能力不限于编码,上手简单,但刚发布存在不稳定情况。

探索AGI