评估方法」共找到 2123 篇相关文章

算法论文8

谷歌Jeff Dean和多位图灵奖得主合著论文,全面剖析了AI

谷歌Jeff Dean和图灵奖得主John Hennessy等联合发布报告《塑造AI对数十亿人的影响》,拒绝AI极端观点,选择务实。报告剖析打破“饭碗焦虑”、重塑教育医疗等内容,Laude研究所也开展实战评估项目。

新智元
开源动态8

HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴

蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。

机器之心
推荐文章8

一篇200+文献的视觉强化学习技术最新综述

NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。

PaperAgent
开源动态8

打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
产品应用7

字节跳动Seed1.5-VL复杂图表精准抽取,Deep Think是多模态未来的主流

文章介绍字节跳动的Seed1.5-VL模型,它能精准抽取复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,预训练语料丰富,后训练结合多种方法,推荐在huggingface体验。

CourseAI
算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
推荐文章8

以前写书比看书慢,现在看书比写书慢——AI时代最被低估的变局

AI时代信息生产速度超消费速度,这是文明范式转移。过去知识稀缺,现在过剩,多数人应对信息爆炸的方法有误。应从消费信息转为使用信息,这还会重塑教育、社交与社会分层。

AI Reading Hub
推荐文章7

搞不懂Skills?看看Claude Code内部工程师们是怎么玩的

文章来自Anthropic的Claude Code团队工程师,介绍了Claude Code中Skills功能。阐述Skills定义、类型,给出制作技巧,如避免陈述显而易见内容、构建陷阱部分等,还提及分发、管理、组合及衡量效果的方法

机器之心
8

重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!

中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。

机器之心
新闻资讯7

Anthropic "泄露"Claude Mythos 最强模型到底有多猛?

Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。

CourseAI