「信息获取范式」共找到 1707 篇相关文章
The Batch: 891 | 用于科学发现的人工智能
Adji Bousso Dieng展望2026年,希望AI从‘提升效率的工具’变为‘推动科学发现的催化剂’。当前深度学习主导范式是‘插值’,难以应对数据分布‘尾部’,应转向能驾驭分布尾部的技术,把多样性作为核心目标。
一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF
MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。
Relink:为GraphRAG动态构建证据图
大语言模型在开放域问答中有‘幻觉’问题,GraphRAG结合LLM与知识图谱缓解此问题,但现有方法有缺陷。作者提出‘推理并构建’新范式和Relink框架,实验显示其性能领先,对RAG系统设计有启示。
全新唇同步技术OmniSync,遮挡,侧脸不在话下
唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。
机器人为什么要拟人?终于有人正确回答了
今年6月,英伟达发布Isaac GR00T人形机器人参考平台,深度机智发布论文Human - as - Humanoid。具身智能瓶颈是数据,深度机智以人类学习范式破局,完成全栈技术闭环,领先优势扩大。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
谷歌开源非结构化数据抽取工具
谷歌开源 Python 库 LangExtract,用 LLM 从非结构化文本文档提取结构化信息。它定位精确、输出可靠,针对长文档优化,有交互式可视化,支持多模型,适应多领域,还给出快速开始示例。
刚刚,清华黄高、北大刘譞哲等入选2026科学探索奖
2026年「科学探索奖」获奖名单揭晓,50位青年科学家入选,覆盖10个领域。其中信息电子领域5人,包括清华黄高、北大刘譞哲等,他们研究方向多元,成果显著,对AI发展意义重大。
Transformer祖传设计遭暴击,COLM顶会三篇论文发难
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。