「模型可解释性」共找到 10033 篇相关文章

开源动态8

英伟达开源深度研究引擎:企业级数据不出门,研究自动做

NVIDIA推出AI-Q Blueprint,将深度研究流水线打包成Agent Skill,解决企业级数据处理难题。它能让企业数据不出门,代理框架可派任务并获报告,还支持多种认证模式,代码库可本地部署,专为深度研究打磨。

AIGC开放社区
产品应用8

刚刚,智谱砍掉OpenClaw最大门槛!1分钟装好,一键塞进飞书

OpenClaw爆火但安装门槛高,催生天价代装生意。智谱发布AutoClaw(澳龙),将其打包为一键安装桌面应用,小白1分钟上手。内置Pony - Alpha - 2模型,支持模型热插拔与飞书集成,50 + 技能开箱即用。

新智元
算法论文7

BeyondSWE:AI编程80分是真的强,还是考卷太简单?

前沿模型在SWE - bench Verified测试中得分超80%,但该测试像开卷填空。中国人民大学提出BeyondSWE重新设计评测,规模是前者18倍,模型得分全跌破45%。还提出SearchSWE框架,结果显示搜索与编码能力融合待提升。

PaperAgent
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推三款模型。Grok 4上线,有三个订阅版本。马斯克称其智能超博士生,多项基准测试领先,编码或超Cursor。其性能强大源于训练投入和计算扩展。

AI前线
算法论文8

Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题

斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。

深度学习自然语言处理
新闻资讯7

ChatGPT本来要5天后关掉

翁家翌在播客透露,起初推出ChatGPT是为收集用户数据,预期5天后关闭。他是OpenAI多代大模型发布贡献者,还分享了OpenAI内部情况,如模型训练、迭代速度等问题,也谈及自身经历和对AGI看法。

花叔
开源动态8

设计师的天塌啦!!!1k Star Editable Design

本文介绍上线不久就收获1k Star的开源项目Editable Design,该项目针对AI设计交付后无法灵活修改的痛点,提出由Agent生成带结构的可编辑设计,支持HTML和PPTX格式,适配需要反复修改的设计场景。

小华同学ai
算法论文8

智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象

上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。

深度学习自然语言处理
新闻资讯7

deepseek v4.1? 梁圣的端午礼物突袭。

群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。

探索AGI
推荐文章7

大厂的AI不限量补贴终会结束!Hermes Agent作者:开源框架真正的狠招是把Claude对Anthropic的忠诚抢过来

科技创作者 Peter Yang 对话 Hermes Agent 作者之一 Karan Malhotra,探讨 Hermes Agent 与其他产品的差异、模型谄媚问题、开源意义等。Karan 指出其独特自我改进系统与专注用户需求特点,还提及让模型更贴合用户的方法。

AI科技大本营