多模态数学推理」共找到 2934 篇相关文章

产品应用7

GLM4.5实测:审美不如R1,全栈还不大可用,别急冲

7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。

AI产品黄叔
8

ART:构建可靠智能体的强化学习新框架

现有AI智能体在真实场景表现不稳定,阻碍其应用走向生产。ART开源强化学习框架诞生,通过分离“前端”与“后端”、兼容OpenAI推理端点等创新化解困境,还给出使用方法,在案例中展现强大效能与经济性。

AI工程化
新闻资讯7

刚刚,ARC-AGI-3发布!人类100分,最强AI零分

ARC Prize发布ARC - AGI - 3预览版,测试范式从静态谜题到交互式游戏。新引入交互式推理基准测试,人类轻松通关,最强AI却全军覆没。但测试引发社区质疑,奖金设置也遭吐槽,且存在体验和技术问题。

AGI Hunt
产品应用8

Qwen3-Embedding 全揭秘:从技术到服务,打造高效AI产品的关键路径

文章全面揭秘 Qwen3-Embedding,介绍其核心原理、优势、应用场景。还给出在 PAI 和百炼平台的使用方法,含部署、推理、微调等。通过对比实验,凸显其低延迟、低成本特点,未来将成语义理解核心设施。

阿里云开发者
7

2027年实现AGI?计算物理学家怒怼:纯属无稽之谈!

知名博主Scott Alexander领衔的项目称AI将在2027年达超人智能。但计算物理学家经研究指出,该预测模型漏洞百出,如数学错误、曲线选择无依据、图表与模型不符等,即便新模型改进部分问题,多数批判仍成立。

AGI Hunt
开源动态8

百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3

今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。

Founder Park
开源动态8

从AI Agent到Agentic AI:开源如何助力开发者解决行业痛点?

2025年全球开源软件项目数量增长,中国企业贡献显著。字节跳动在火山引擎原动力大会开源开发者日上,多位负责人分享开源经验,探讨其为AI Agent带来的技术改变,展示解决行业痛点的理念与实战经验。

InfoQ
算法论文8

通向世界模型关键一步:EX-4D来了,实现单目视频到自由视角生成

去年Sora等模型革新视频生成领域,相机可控的视频生成技术是构建世界模型核心。但从单视角生成极端视角视频是难题,PICO - MR团队提出EX - 4D,能从单目视频生成新视角视频,多方面表现出色。

机器之心
开源动态8

集GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent

本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。

GitHubStore
算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理