Hermes V3」共找到 2384 篇相关文章

开源动态8

3B小模型吊打72B巨头!轻量级文档解析OCR,性能超Gemini,高效且精准!

Yuliang - Liu团队在GitHub开源轻量级文档解析模型MonkeyOCR,以SRR三元组范式实现高效精准解析,3B参数模型在英文文档解析上超Gemini 2.5 Pro和Qwen2.5 - VL - 72B,还介绍了安装部署、适用场景等。

开源星探
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
产品应用7

五一我没开电脑,但我的 Agent 团队没放假 | 如何用Hermes Agent移动办公

作者五一旅行未开电脑,但工作未停,靠Hermes Agent移动办公。介绍了其基本链路,还将Agent分工,如个人助理、内容总监等,也提到多Agent群聊协作,最后指出一人公司用Agent需明确流程、完善知识库,人要做好判断。

AI产品黄叔
产品应用8

更快更省!Vidu Q3硬核升级打响AI视频普惠第一枪 | 甲子光年

2026年AI视频行业内容产出增长迅猛,但成本上涨、生成慢等问题凸显。生数科技的Vidu Q3模型全面升级,生成速度提升5倍、价格降低,适配多场景,为AI视频普惠工业化提供范例。

甲子光年
开源动态8

腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧

28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。

AIGC开放社区
开源动态8

从分钟级等待到20倍超速:LightX2V重写AI视频生成速度上限

今年,开源项目LightX2V在ComfyUI社区走红,单月下载超170万次。它是面向低成本、强实时视频生成的推理技术栈,能在消费级显卡上高效生成视频,还支持多种模型和硬件,覆盖不同用户需求。

机器之心
算法论文8

ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架

北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。

机器之心
开源动态8

YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码

Meta 人工智能研究院的 DINOv3 是基于自监督学习的视觉大模型,解决诸多问题且无需微调,在多任务表现出色。将其引入 YOLO12 后,在不同规模数据集上检测性能显著提升,还分享训练自定义数据集代码。

机器学习AI算法工程
算法论文8

空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer

香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。

机器之心