开源百科平台」共找到 4011 篇相关文章

开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
算法论文8

大象秒变挖掘机!三维变形新突破,无需额外训练 | CVPR'26

南京大学与北京大学提出MorphAny3D,无需额外训练即可让三维生成模型实现跨类别平滑变形。它通过创新注意力机制融合源与目标特征,精准控制结构与时序,效果远超传统方法,代码已开源

新智元
开源动态7

测试的同学要起飞啦, Cursor / Claude 党福音:一个 MCP 服务器把 Android 真机接进你的对话框

DroidMind是开源MCP服务器,将Android的ADB能力结构化暴露给支持MCP的AI客户端。适合调试、测试等场景,能让AI执行设备操作,有设备管理、调试信息获取等功能,使用体验友好且安全。

小华同学ai
开源动态8

英伟达开源全新大模型:黄仁勋不想只「卖铲子」

2025年底英伟达宣布开源全新模型家族Nemotron 3,含Nano、Super和Ultra。它融合Mamba、Transformer和MoE技术,有诸多创新。这不仅是产品更新,更是战略突袭,标志着英伟达想构建AI闭环开放生态。

新智元
新闻资讯8

第四届智能流体力学产业联合体大会在深圳隆重召开

2025年11月29日,第四届智能流体力学产业联合体大会在深圳召开。众多专家学者参会,交流前沿问题与成果。会上发布“多智能体协同流体力学工业软件平台”“风神NF3”数字孪生风洞等,还围绕多议题研讨。

力学与人工智能
开源动态7

Voices 能够让 Java 应用程序快速实现文本到语音转换

Voices 是开源文本转语音项目,为 Java 17 及以上应用设计,无需外部 API 或手动安装软件。可按字典或 OpenVoice 为不同语言生成音频,其使用 ONNX Runtime 加速,还介绍了使用方法和配置。

InfoQ
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。

量子位
产品应用8

AI百科全书SciencePedia:当马斯克Grokipedia遭遇滑铁卢,有个中国团队默默把活儿干了

在知识爆炸时代,传统互联网平台难以满足用户获取深度见解的需求,马斯克的Grokipedia也未达预期。深势科技等团队推出SciencePedia,它能理解知识关系,追踪科学脉络,让真知高效抵达用户。

量子位
新闻资讯7

种子轮、2500 万美金,营销 Agent 创业公司,帮客户销售额增长 40%

营销AI Agent公司MAI获2500万美元种子轮融资,其产品Google Ads Agent帮客户销售额增超40%。它解决广告管理难题,让中小企业也能用先进技术,融资将用于平台研发。

Founder Park
算法论文8

Flash-Searcher:Web Agent的并行革命

当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源

深度学习自然语言处理