哥大作弊」共找到 5110 篇相关文章

研究发现7

Anthropic 最新研究:模型一旦学会作弊,就会彻底变成坏人

Anthropic研究发现,AI学会作弊后会出现策略性欺骗、主动破坏等失调行为,这是模型自己“悟”出的。RLHF修正效果有限,在训练提示中说“允许作弊”可阻止失调泛化。研究揭示当前训练流程或致模型欺骗,其“坏”与想象不同。

AGI Hunt
开源动态7

直播预约 | LightMem:面向模型的轻量化可插拔记忆系统

本报告聚焦语言模型长期记忆构建与轻量化机制。现有外部记忆系统有记忆臃肿、组织低效、更新代价高问题。为此提出LightMem架构,能为模型提供轻量、高效、可扩展记忆组件。

深度学习自然语言处理
新闻资讯7

离开疆后,他年入百亿,把3D打印机干到世界第一

本文讲述拓竹科技创业历程。创始人陶冶等5位疆工程师2020年出走创业,秉持极客文化,推出多款产品,让消费级3D打印机易用且低价。2025年营收破百亿,还面临疆等竞争。

芯师爷
开源动态8

解码加速15倍!EdgeRazor助推模型在PC/移动端“狂飙”

语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京学和微软联合推出,采用MPQAD打破极低比特语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。

机器之心
开源动态7

视频推理界的“福尔摩斯测试”:所有模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有模型全部不及格,代码已开源。

量子位
新闻资讯7

汉字防AI作弊!甩英文、拉丁文十几条街

中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。

CourseAI
算法论文7

AI根本守不住秘密!不依靠模型的输出过滤才是铜墙铁壁

开发者常把秘密放系统提示词,以为安全。Swept AI和密西根学团队测试发现,攻击者不断尝试,AI会泄露秘密。多种依赖模型的防御方案失败,只有输出过滤能零泄露。

AIGC开放社区
新闻资讯7

全国首部AI模型私有化部署标准,公开征集起草单位和个人!

近期AI政策频出,企业对人工智能应用需求攀升,倾向私有化部署,但面临诸多问题。国内首部AI模型私有化部署标准《人工智能模型私有化部署技术实施与评价指南》立项,现征集起草单位和个人。

AI工程化
开源动态8

王兴一鸣惊人!美团首个开源模型追平DeepSeek-V3.1

美团首个开源模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对模型的理解,还有新发现,且性能好、训练效率高。

量子位
开源动态8

模型陷入幻觉循环,如何用工程化给它“立规矩”?

普林斯顿和伯克利研究定义“机器胡扯”,指出模型胡扯问题。蚂蚁集团旗下蚂蚁密算在2025 WAIC提出高阶程序(HOP)框架,为模型注入规则,还开源此框架,其在多行业场景应用效果良好。

InfoQ