视觉基元推理」共找到 2538 篇相关文章

新闻资讯8

除了AGI已来和死亡,我们为黄仁勋重磅访谈总结了50条AI最前沿判断

2026年3月23日黄仁勋在播客访谈提出众多前沿判断,如AGI已来,Agent时代开启;智能会成商品,人性才稀缺;推理成本高;合成数据非旁门左道等,还谈及公司架构、算力、供应链等话题。

新智元
新闻资讯7

老黄大出血!OpenAI背刺英伟达,微软自研芯连夜拆掉CUDA护城河?

2026年1月26日微软官宣第二代自研AI芯片Maia 200上线,还推出软件Triton。它塞满SRAM,推理成本更低、效率更高。这让英伟达面临生存危机,AI算力圈也变天,降本成关键。

新智元
新闻资讯8

GPT-5.2 上线!全面超越 Claude Opus4.5 及 Gemimi 3.0 Pro

OpenAI 正式宣布 GPT-5.2 全面上线,一口气推出三个版本。GPT-5.2 Thinking 在推理能力上拉开代差,是 OpenAI 首个达人类专家水平的模型。各版本定位清晰,不同用户使用时间有别。

AGI Hunt
开源动态7

vLLM 正式支持 PaddleOCR-VL

11月4日,vLLM项目宣布正式支持PaddleOCR-VL模型。该模型专注文档解析,参数量仅0.9B。合作降低部署门槛,推理效率更高,官方还给出部署指南和配置建议,流程快速完成可作榜样。

AI工程化
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
开源动态7

一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF

MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。

GitHubStore
推荐文章7

从零开始200行python代码实现LLM

文章从传统思路出发,用Python实现极简大语言模型,介绍从零础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch础,最后实现pytorch版Bigram模型,后续将实现完整GPT。

阿里云开发者
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位
算法论文8

ICLR 2026 Oral | 让大模型学会“像法医般思考”,实现可解释、可泛化的深度伪造检测

生成式AI发展使深度伪造技术安全隐患受关注,现有检测器表现不佳。中科院自动化所联合蚂蚁集团提出Veritas框架,构建HydraFake数据集,赋予大模型“模式感知推理”能力,实验效果超现有检测器,还给出未来研究方向。

深度学习自然语言处理