视觉推理任务」共找到 3980 篇相关文章

算法论文8

超低标注需求,实现医学图像分割!UCSD提出三阶段框架GenSeg

GenSeg用AI生成高质量医学图像及对应分割标注,在仅有几十张样本时也能训练出媲美传统深度模型的分割系统,显著降低医生手工标注负担。它是通用、与模型无关的框架,可集成到现有分割模型。

新智元
产品应用8

AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击

Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。

AI工程化
新闻资讯7

思维链之父跳槽Meta,不只因为1亿美元!离开OpenAI前泄天机

硅谷人才争夺战升级,Meta砸钱抢人,思维链之父Jason Wei从OpenAI跳槽到Meta。他离职前发博客,谈及从强化学习获得的人生启示,还阐述AI领域验证非对称性概念及重要性。

新智元
开源动态8

腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s

腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化等全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。

腾讯技术工程
新闻资讯8

DeepMind 再放大招,AlphaGenome 能一次性处理百万碱基对,基因组里的“垃圾代码”这下藏不住了

Google DeepMind发布AI模型AlphaGenome,可预测遗传变异对基因调控的影响。它能处理百万碱基对,结合关键技术,性能顶尖,还能直接建模RNA剪接点,已面向非商业研究开放,引发医疗AI应用讨论。

InfoQ
开源动态7

开源多模态大模型EarthMind,观测地球统一框架

地球观测数据复杂,现有多模态模型难适用。意大利、德国多所高校研究人员联合开源多模态大模型EarthMind,引入空间注意力提示模块,实现跨模态融合和多粒度理解,解决地球观测难题。

AIGC开放社区
产品应用8

谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖

Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。

量子位
算法论文7

美7000万人或被取代,Agent光速卷入职场!北大校友、杨笛一新作

斯坦福大学研究团队调查104个职业领域1500名专家及52名AI研究员,构建WORKBank数据库。研究发现职场AI需求与能力错配,工人对AI态度不一,还揭示未来人类技能变化趋势。

新智元
算法论文8

国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达

今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek大模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。

InfoQ
推荐文章7

游戏教父 John Carmack:LLM 不是游戏的未来

游戏教父 John Carmack 认为 LLM 不是游戏未来,强调交互式体验学习重要性。他分析游戏学习现状,指出 Atari 游戏研究虽有成果但仍存问题,还探讨强化学习多方面挑战及应对思路。

InfoQ