大模型智能体」共找到 10587 篇相关文章

开源动态8

清华团队开源发布首个结构化数据通用模型

2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极数”(Limi X)结构化数据通用模型。它融合结构因果推断与预训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。

AI科技评论
新闻资讯7

刚刚,智谱正式成“全球模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”

今天,智谱在港交所正式挂牌上市,成“全球模型第一股”。其有技术、产品、商业化等竞争力,但未盈利,研发投入。专家认为国内模型厂商上市是抢收确定性,而OpenAI等是扩展无限性。

InfoQ
开源动态8

AgentCPM-Explore开源,4B 参数突破端侧智能模型性能壁垒!

当全行业争论30B能否挑战万亿参数时,清华学等联合研发的AgentCPM - Explore智能模型用仅4B参数,在深度探索类任务有出色表现,且开源全流程配套工具,打破小模型性能局限。

MCP Server
算法论文8

模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态模型处理结构化图像有误差放、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位
新闻资讯7

LeCun离职后不止创一份业!押注与模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流模型路线不同,其Kona模型在数独测试上表现远超模型

量子位
新闻资讯8

专治智能体盲跑!微软发布AI Agent 5可观测性,打通任督二脉

今天凌晨微软官网发布AI Agent 5可观测性最佳实践,解决智能体盲跑等难题。介绍了智能体可观测性概念和好处,展示5个应用案例,还阐述5实践,如选模型、持续评估、集成CI/CD等。

AIGC开放社区
算法论文7

多模态模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估模型视觉推理能力。结果显示,主流模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出模型在复杂多模态推理任务中能力不足。

量子位
新闻资讯8

模型竞赛转向:决胜关键为何是“后训练”?

模型价值主战场正向后训练转移。xAI发布的Grok 4通过后训练取得强性能,在多项测试中领先。后训练可解决通用模型产业落地难题,不同公司探索新方法,且后训练有五关键要素,阿里云提供一体化支撑。

InfoQ
新闻资讯7

250份文档就能给模型植入后门:不分参数规模

Claude母公司Anthropic联合英国AISI和图灵研究所研究发现,仅250份恶意文档就能给不同规模模型植入“后门”漏洞,打破了以往对模型数据中毒的认知,给厂商提了个醒。

量子位
算法论文8

AAAI 2026|视频语言模型到底可不可信?23款主流模型全面测评来了

合肥工业学与清华学团队推出视频语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。

机器之心