高级推理测试」共找到 3444 篇相关文章

开源动态8

刷新SOTA高出19.05分!英伟达开源OmniVinci全模态理解模型,只用1/6的数据,实现全方位超越

英伟达研究团队发布OmniVinci研究,该全模态理解大语言模型用六分之一训练数据,在全模态理解基准测试成绩超现有顶尖模型19.05分。它靠创新架构和数据策略实现效率与性能双突破。

AIGC开放社区
新闻资讯7

美国航天局与谷歌合作,打造AI医疗助手,以保证宇航员健康

Techcrunch消息,美国宇航局NASA和谷歌合作开发AI医疗助手CMO - DA,保障前往火星的宇航员健康。它有多种模态功能,在谷歌云运行。经测试诊断准确性较高,未来还会增加数据源和情境感知能力。

AIGC开放社区
新闻资讯8

重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」

OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。

AI寒武纪
开源动态7

一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF

MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。

GitHubStore
推荐文章7

从零开始200行python代码实现LLM

文章从传统思路出发,用Python实现极简大语言模型,介绍从零基础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch基础,最后实现pytorch版Bigram模型,后续将实现完整GPT。

阿里云开发者
推荐文章7

在边缘应用中,实现 Kubernetes 的主动扩缩容

Kubernetes已成为现代IT核心平台,在云环境应用广泛。但在边缘计算场景,其HPA功能有局限。文章介绍基于CPA构建自定义扩缩器,详述其评估算法、实现方式,经测试CPA比HPA表现更优,适合边缘环境。

InfoQ
算法论文8

ICLR 2026 Oral | 让大模型学会“像法医般思考”,实现可解释、可泛化的深度伪造检测

生成式AI发展使深度伪造技术安全隐患受关注,现有检测器表现不佳。中科院自动化所联合蚂蚁集团提出Veritas框架,构建HydraFake数据集,赋予大模型“模式感知推理”能力,实验效果超现有检测器,还给出未来研究方向。

深度学习自然语言处理
算法论文8

Relink:为GraphRAG动态构建证据图

大语言模型在开放域问答中有‘幻觉’问题,GraphRAG结合LLM与知识图谱缓解此问题,但现有方法有缺陷。作者提出‘推理并构建’新范式和Relink框架,实验显示其性能领先,对RAG系统设计有启示。

PaperAgent
产品应用7

Target 公司借助生成式 AI 推荐将“加入购物车”互动率提升 11%

Target公司为应对零售目录中配套产品组合复杂挑战,部署基于生成式AI的配件推荐系统GRAM。它用大模型分析产品数据,结合人工审核,A/B测试显示提升了互动率和转化率,已全面投入生产。

InfoQ
产品应用7

The Batch: 964 | Claude 亮相另一款 Opus

Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。

DeeplearningAI