观测的暴露度」共找到 10658 篇相关文章

开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失背景下,作者团队发布聚焦AI拟人化中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者
开源动态8

10K Star!这个 AGENTS.md 开源项目太赞了,AI 编程助手彻底悟了!

AI 在看 README 时理解能力差,被戏称“智商只有三岁”。AGENTS.md 是专门写给 AI 编程智能体文档格式,已获 10K Star,可助其理解项目,还介绍了与 README.md 区别、使用方法等。

开源星探
开源动态8

长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破

月之暗面团队Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。

AIGC开放社区
算法论文8

一篇19种自进化Agent Skill框架最新综述

这篇来自Rutgers大学和UNC Charlottesurvey,首次系统梳理Agent技能进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。

PaperAgent
开源动态8

Nathan Lambert:GLM-5.2是开源Agent重大突破,连锁反应将渗透进更广泛经济体

开源AI观察者Nathan Lambert称GLM - 5.2能做顶尖付费AI才能做事,是开源Agent重大突破。其表现超预期,是首个在编程框架中用着‘手感极佳’开放权重模型,将给闭源模型带来价格压力。

AI寒武纪
产品应用8

16 年老程序员用 Claude Code 搞副业:我只手敲了 1000 行,剩下 95% 代码靠自动生成

Anthropic公司AI编码助手Claude Code推出4个月吸引11.5万开发者,单周处理代码量达1.95亿行,预估年化收入约1.3亿美元。开发者Indragie用其构建macOS应用,2万行代码中手写不到1000行,还分享使用技巧与体验。

InfoQ
产品应用7

太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%

在PDF文档解析领域,复杂表格解析是难题。今天分享OCRFlux是基于qwen2.5vl - 3B模型微调解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。

PaperAgent
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑大模型推理能力论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力方法。

新智元
产品应用7

Anthropic总想摔碎程序员饭碗,甩出了“以后只招两种人”名单。

昨天Anthropic发布新产品Claude Tag,被Karpathy赞为LLM交互第三范式。Claude Tag与之前Claude Code远程插件有4方面差别。产品负责人Fiona Fung分享,Anthropic人均代码交付量剧增,招人只看两类人。

探索AGI
新闻资讯7

霍尔木兹海峡封锁18天后,芯片产业还能撑多久?

霍尔木兹海峡封锁18天,全球半导体产业担忧能源储备还能撑多久。芯片产业存在‘能源软肋’,关键材料供应有‘垄断性风险’,全球供应链有关联性风险,凸显了产业在效率与安全间寻求平衡必要。

芯师爷