可解释性技术」共找到 6324 篇相关文章

算法论文8

建模世界偏好:偏好建模中的Scaling Laws

研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模扩展性等问题。

通义千问Qwen
推荐文章7

用AI写代码的真实体验:聪明却“不靠谱”的顾问,你敢用吗?

作者Luke Kanies曾是AI与LLM怀疑者,试用Vibe Coding后,认为要把AI当不太靠谱的外部顾问。用AI学Swift编程,发现它是糟糕架构师,但找语法错误快,相处中让其做琐碎工作,不能全信它。

宝玉AI
新闻资讯8

复制失败与脏碎片:Linux 页面缓存漏洞影响所有主流发行版

一周内,两处 Linux 内核本地权限提升漏洞“复制失败”和“脏碎片”被披露,使无特权本地用户获 root 权限。前者由 Theori 用 AI 工具发现,后者由 Hyunwoo Kim 发布,均影响页面缓存,与“脏管道”属同一类漏洞。

InfoQ
新闻资讯7

高通组局,宇树王兴兴说了一堆大实话

在2025骁龙峰会·中国上,宇树王兴兴等大咖畅所欲言。王兴兴指出机器人领域技术路线不同进展慢,建议模型开源,还强调芯片对机器人的重要性;李大海认为端侧模型是Agent核心;勾晓菲谈汽车服务竞争;耿增强呼吁Agent形成行业标准。

量子位
新闻资讯7

Google 发布 142 页年度DORA 报告:90% 开发者每天花 2 小时使用AI,比去年增长14%

Google发布142页年度DORA报告,显示90%开发者每天花2小时用AI,比去年增14%。开发者对AI代码信任谨慎,看法分化,速度提升比质量改善明显。报告还分析团队类型、采用时间等,指出技术限制和就业现状。

AGI Hunt
开源动态8

腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文

8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。

AI前线
新闻资讯7

狂拿大模型明星订单,一家清华系HPC-AI Infra公司浮出水面

本文介绍清华系计算创业公司是石科技,其93年创始人闫博文不囤算力仍拿下大模型明星公司订单。团队技术实力强,3次获戈登·贝尔奖。公司构建全栈能力,为多领域提供服务,未来想以算力赋能各行业。

量子位
开源动态7

24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练

Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还与All Hands AI框架配合。

量子位
算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
新闻资讯7

初稿抢先看!13家单位共同起草全国首部AI大模型私有化部署标准智合标准化建设

由智合标准中心组织起草的《人工智能大模型私有化部署技术实施与评价指南》团体标准立项,这是国内首部相关标准。它全流程覆盖、多方面融合、三方协作,能解决企业痛点,现征集起草单位和人,5月15日开研讨会。

AI工程化