公式识别」共找到 288 篇相关文章

开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。

开源星探
新闻资讯7

每周产业洞察|校园母题与流量要素成为AI短剧行业的爆款公式

近期AI短剧行业数据亮眼,TikTok生态和国内市场规模惊人,但淘汰率也高。其有“校园母题+流量要素”爆款公式,AI降低制作成本,工具平台参与度加深,且用户画像向男性、游戏用户迁移。

郎园Station
算法论文8

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。

量子位
算法论文8

从「时域建模」到「频域融合」:中山大学团队为传感器人体活动识别提供新思路 | TPAMI 2026

中山大学团队在IEEE TPAMI发表研究,用“三重频域融合”(TSF)框架突破传感器人体活动识别(HAR)领域核心瓶颈。该框架从三个全新“视角”审视问题,经多数据集评估表现出色。

AI科技评论
新闻资讯8

GPT-5.2改写粒子物理教科书!人类手算32项算不出,AI一行公式搞定

OpenAI与多校研究者发布预印本论文,GPT - 5.2 Pro猜出关键公式,后被OpenAI内部模型证明。它推翻粒子物理教科书结论,指出单负树图振幅在特定条件下不为零,这是其在基础科学第三个公开贡献案例。

量子位
算法论文8

AAAI 2026|新突破:北大彭宇新团队提出可见光-红外终身行人重识别方法CKDA

终身行人重识别有重要应用价值,但现有方法在学习特定模态新知识时,会阻碍跨模态公共旧知识保留。北大彭宇新团队提出CKDA方法,解耦并净化不同模态信息,实现跨模态知识权衡,在相关基准上取得最优性能。

机器之心
算法论文8

因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116

浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。

AI科技评论
产品应用7

本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案

这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。

GitHubStore
产品应用7

八爪鱼微电子:打造感算一体的智能识别生态

八爪鱼微电子成立于2019年,是国内智能门锁芯片与模组领域领先企业。它构建‘感算一体’底层技术体系,还通过标准共建、创新平台构建等推进生态建设,欲以技术与生态驱动行业创新。

芯师爷
开源动态8

Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片

Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。

AI工程化