「推理数据」共找到 4215 篇相关文章
Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与全栈豪赌,更是找回了“老谷歌”那个味儿
截至2025年底,Gemini在桌面和移动网页端单次使用平均停留时长超ChatGPT,下载量也快速追赶。谷歌CEO Sundar Pichai称这是全栈投入成果,还提及早期谷歌文化回流,也谈到未来十年押注等内容。
Claude Skills 写作指南:从0到1看完就会,不会来找我
本文介绍Claude Skills写作指南,指出传统提示词使用麻烦,而Skills能解决问题。阐述其适用场景、定义、原理,还讲了创建方法、作者实践及完整写作工作流,可按需管理提示词。
把 Nano Banana/Gemini 3 Pro 榨干!这几点你必须知道
Gemini 3 放出 Pro 和 Nano Banana Pro 两条线,前者主打长上下文、多模态推理,后者专攻像素级生成。文章提炼精髓,给出“通用 + 像素”双模实战笔记,介绍两者使用要点及创意场景实测。
超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025
视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决长跨度帧运动处理和参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。
AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型
火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。
MeshCoder:以大语言模型驱动,从点云到可编辑结构化物体代码的革新
生成式AI在三维空间面临挑战,传统3D生成成果粗糙难编辑。团队推出MeshCoder,将三维输入翻译成结构化代码,有分部件生成等优势。介绍其实现路径、实验性能,也指出局限并展望未来。
两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用
两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
Flash-Searcher:Web Agent的并行革命
当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源。
AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight
INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。