「验证不对称性」共找到 2064 篇相关文章
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
疯了……Claude 最强风控:验你实名身份证!
Anthropic更新支持文档,宣布在Claude平台引入身份验证机制,目的是防滥用、执行政策和履行义务。验证需有效证件、带摄像头设备,由Persona Identities处理数据。此前OpenAI也有类似机制,这或加剧AI使用人群分化。
20%的美国打工人把活儿甩给AI!被替代的是任务,不是岗位
8月6日,Epoch AI联合Ipsos发布职场调查报告,20%美国就业者将工作甩给AI,表明活儿在人和AI间重新分配。AI参与广但不深入,用时情况不一,输出多需修改,先冲击外包工作,且使用不均衡。
调高一档推理强度,成本可能翻几倍:大模型思考原理讲清楚
文章详细讲解推理强度原理,指出其不改模型,只改草稿长度。还说明模型多思考能提高答题准确率的原因,剖析贵和慢的原因,介绍三种控制形态,并给出判断推理强度档位的框架。
黄仁勋曝英伟达养了61个CEO、从不炒犯错员工:CEO是最脆弱群体
黄仁勋在访谈表示英伟达有61个“CEO”,犯错不炒人,称CEO是公司最脆弱群体。他还谈及英伟达发展、用人哲学,预测五年后AI将改变计算机模式,增加工作机会,他本人不喜演讲但为公司尽力。
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
几毛钱的芯片,利润直追英伟达
苹果曾被小小基带芯片困扰,芯片世界里有很多单价低、工艺要求不高的“小玩意”,但其利润却直追英伟达。如英飞凌、博通,它们靠“人脉”和网络效应赚钱,且所在领域不卷,抱着铁饭碗。
作为一个接过Aha单的YouTube博主,我来聊聊这个AI产品
文章指出当下AI Agent分化为通用型、生活服务型、开发者工具型和垂直行业型四类。以Aha为例,介绍其作为达人营销垂直Agent平台,在筛选达人、匹配合作、保障安全等方面的优势,还分析了适用与不适用的产品情况。
AI写CUDA算子准确率92%,到国产芯片只剩4%?上交方法直线拉升,DeepSeek也适用
GPT-5.2写CUDA算子正确率92%,给华为Ascend NPU写算子仅4%,因公开数据少等致‘新硬件冷启动’难。上海交大团队EvoKernel不训新模型、不标新数据,将GPT-5.2正确率从4%拉到83%,还拓展到DeepSeek架构算子。
DeepSeek被曝主动叫停了第二轮融资签约
据彭博报道,DeepSeek第二轮融资临门一脚被按下暂停键,原本预计未来几天签署的投资协议暂不签署。这轮融资计划至少募资100亿元,投前估值不低于4800亿元。暂停或因一份内部交流备忘录泄露。