「观测的暴露度」共找到 10658 篇相关文章
如何定义“人味儿”?——HeartBench评测体系建设实践
在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。
10K Star!这个 AGENTS.md 开源项目太赞了,AI 编程助手彻底悟了!
AI 在看 README 时理解能力差,被戏称“智商只有三岁”。AGENTS.md 是专门写给 AI 编程智能体的文档格式,已获 10K Star,可助其理解项目,还介绍了与 README.md 的区别、使用方法等。
长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破
月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。
一篇19种自进化Agent Skill框架最新综述
这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。
Nathan Lambert:GLM-5.2是开源Agent重大突破,连锁反应将渗透进更广泛的经济体
开源AI观察者Nathan Lambert称GLM - 5.2能做顶尖付费AI才能做的事,是开源Agent重大突破。其表现超预期,是首个在编程框架中用着‘手感极佳’的开放权重模型,将给闭源模型带来价格压力。
16 年老程序员用 Claude Code 搞副业:我只手敲了 1000 行,剩下 95% 代码靠自动生成
Anthropic公司的AI编码助手Claude Code推出4个月吸引11.5万开发者,单周处理代码量达1.95亿行,预估年化收入约1.3亿美元。开发者Indragie用其构建macOS应用,2万行代码中手写不到1000行,还分享使用技巧与体验。
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光
苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。
Anthropic总想摔碎程序员饭碗,甩出了“以后只招两种人”名单。
昨天Anthropic发布新产品Claude Tag,被Karpathy赞为LLM交互第三范式。Claude Tag与之前的Claude Code远程插件有4方面差别。产品负责人Fiona Fung分享,Anthropic人均代码交付量剧增,招人只看两类人。
霍尔木兹海峡封锁18天后,芯片产业还能撑多久?
霍尔木兹海峡封锁18天,全球半导体产业担忧能源储备还能撑多久。芯片产业存在‘能源软肋’,关键材料供应有‘垄断性风险’,全球供应链有关联性风险,凸显了产业在效率与安全间寻求平衡的必要。