「医疗评测」共找到 783 篇相关文章
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式
上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统多模态架构问题,有全离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜
豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架
人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。
给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化
伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。
Nature子刊:攻克医疗器械「看不清」难题,赋予自动驾驶视觉
MicroSyn-X首创无需真实数据的AI合成影像技术,让机器在无标注虚拟X光中学会追踪微型手术器械,突破医疗数据稀缺瓶颈,为自动化微创手术提供新路径,且代码和数据已开源。
Skills刚火,就有零Skill的Agent来了…
Skills爆火之际,云玦科技团队提出不用Skills的零Skill Agent。它以Gemini 3 Pro为后端,在多个评测集表现出色。采用原位自进化框架,开源且成本低,或助力开源模型弯道超车。
今年看到最系统的AI Agents时代Memory综述~
分享由NUS、人大等联合出品的《Memory in the Age of AI Agents: A Survey》。用三维框架讲透200+篇论文,提出新三大记忆形态,展望7大前沿,还涵盖记忆各方面知识及资源。