「视觉推理任务」共找到 3930 篇相关文章
混元 Hy3 发布:99% 的任务,够用了
腾讯混元模型 Hy3 正式上线,免费使用两周。它是快慢思考融合的 MoE 模型,主打 Coding 和 Agent 场景,性价比高。作者用它做了多项测试,如制作 PPT、开发代码、舆情分析等,还与 GLM - 5.1 对决,表现不错。
让本地大模型不再重复推理的缓存技巧
本地跑大模型时,同样问题换说法问,模型又要重新推理。`constraint-cache`这个Python库可解决此问题,它将语义相似查询规范化为统一缓存键,实现近乎即时的重复查询响应,还避免了随机性响应问题。
AI Spot 学术分享会丨ICLR 2026 深度推理专场
当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。
Nature子刊:攻克医疗器械「看不清」难题,赋予自动驾驶视觉
MicroSyn-X首创无需真实数据的AI合成影像技术,让机器在无标注虚拟X光中学会追踪微型手术器械,突破医疗数据稀缺瓶颈,为自动化微创手术提供新路径,且代码和数据已开源。
南京艺术学院人工智能与计算机视觉算法创新设计成果展示
南京艺术学院‘人工智能与计算机视觉算法创新设计工作坊’汇集师生与专家成果,涵盖多种艺术形式。学生学习多技术完成跨媒体作品,如以《大闹天宫》为蓝本的交互装置,还有探索情绪、文化等主题的作品。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。
重塑AI记忆边界:MemOS开源!时序推理较OpenAI提升159%
近日,记忆张量等多家团队发布面向大模型的工业级记忆操作系统MemOS。它借鉴传统操作系统架构,实现AI记忆结构化管理,性能超OpenAI等方案,未来将成立社区、推进应用及持续迭代。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
快手提出强化学习创新框架RLEP,突破大模型推理瓶颈
OpenAI等模型用强化学习提升推理能力,但面临训练不稳定等挑战。快手Klear团队提出RLEP框架,引入经验回放技术,分经验收集和回放训练两阶段,还采用优化策略,提升大模型训练效率和性能。
拖拽式搭建分布式Agent工作流!Maze让非技术人员几分钟搞定复杂任务
大模型智能体落地有诸多问题,Maze分布式智能体工作流框架可提供一站式解决方案。它是集成分布式执行引擎的全能平台,有四大核心优势,还有可视化工具让非技术人员也能轻松搭建工作流。