「逻辑评估」共找到 1081 篇相关文章
OpenAI深夜开源HealthBench,60个国家合力开发5000段真实对话
今天凌晨1点30,OpenAI开源医疗大模型测试评估集HealthBench。其5000段核心测试对话由60个国家/地区的262名医生打造,采用多轮对话测试。测试显示大模型在医疗保健领域表现显著提升,还介绍了其构建及评估等情况。
全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四
Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。
一篇400+文献最新RAG技术系统性综述
本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
SentGraph:一句一句把多跳RAG“画”成图
传统RAG在多跳场景易‘断链’,因检索单元太胖、逻辑关系乱。SentGraph把检索单元缩到句,按逻辑画三层图。线下建图分拆句、找关系、架桥梁;线上推理有Anchor初选、精炼及路径扩展。实验提升显著,也有局限。
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
AI产业链投资大逻辑:第六集
本集聚焦AI产业链应用层悖论。应用层离用户近、故事性感,但现阶段易让投资者犯错。虽有诸多火热产品且公司估值高,但‘创造价值’与投资者‘以好价格买价值’并非一回事。
AI产业链投资大逻辑:第五集
本集围绕AI产业链算力服务层中云的故事展开,探讨在AWS等超大规模云厂商主导市场下,为何还会冒出新型AI云公司且获高估值。过去十五年云计算市场由巨头主导,2023年后,其自身算力不足使市场结构出现裂缝。
大佬深度解析:Coding Agent的底层运行逻辑是什么?
本文由AI领域知名学者Sebastian Raschka撰写,探讨编码智能体及其编排的设计、工作原理和组件协同。指出智能体周边支撑系统重要性不亚于模型本身,详细阐述编码智能体六大核心构建模块。
从Demo到行业落地的Agents:技术、应用与评估
通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。