声学传感器」共找到 248 篇相关文章

开源动态8

阿里搞了个全能解析,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
新闻资讯7

吴恩达发布论文自动审阅,ICLR上达到接近人类水平

目前学术会议论文评审无统一规范,投稿量膨胀致审稿周期冗长。吴恩达发布‘Agentic Reviewer’,在ICLR 2025数据测试中接近人类水平,现阶段在arXiv研究领域表现佳,但仍处实验阶段。

机器之心
算法论文8

告别「解码饥饿」!中国科学院NeurIPS推SpaceServe,高并发克星

中国科学院计算技术研究所入选NeurIPS 2025的论文提出SpaceServe架构,将LLM推理P/D分离扩展至多模态场景,通过EPD三阶解耦与「空分复用」,解决MLLM推理行头阻塞难题,在Qwen2 - VL系列模型实测中表现出色。

新智元
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
产品应用7

释放创造力:解密 AI 贴纸生成的“神级”提示词模板

文章介绍日本网友分享的 Gem 应用,可上传照片生成各种风格贴纸。详细阐述提示词模板概念、规律特点,还给出波普艺术、日式复古火柴盒等多种贴纸风格提示词库及可用情绪列表,最后鼓励读者动手尝试。

宝玉AI
开源动态8

14.9k Star!Firecrawl 开源的 PDF 智能分类,200 份文档 0.47 秒搞定!

Firecrawl 开源 PDF 智能分类与文本提取库 pdf-inspector,已获超 1.4 万人标星。它能智能分类、感知提取、转 Markdown 及按需路由,性能炸裂,分类快,多项指标领先,还支持多平台。

开源星探
新闻资讯8

谷歌“世界模拟”深夜上线!一句话生成3D世界,支持分钟级超长记忆

谷歌DeepMind发布新一代通用世界模型Genie 3,只需一句话就能生成可实时交互的3D世界。性能大幅升级,支持720P画质等,还能推动具身智能体研究,谷歌期待其助力迈向AGI。

量子位
算法论文8

从打分到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【九】| 层归一化:神经网络的稳定

本文是系列文章第九篇,介绍了神经网络中的层归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明层归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。

AI大模型应用实践
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。

新智元