「文本评估」共找到 1144 篇相关文章
标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估
Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
谷歌发布首个AI+教育RCT实验,传统教材要凉?
谷歌论文提出Learn Your Way AI增强型教科书系统,有两阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景。
2小时入门「个性化联邦学习」,上交清华开源斩获1700+星 | JMLR'25
上海交通大学和清华大学研究人员开源个性化联邦学习代码库PFLlib,含39种算法、3种场景和24个数据集,支持模拟500设备训练,还有隐私保护评估工具,降低研究门槛。
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用
近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。
中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!
中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。
从物竞天择到智能进化,首篇自进化智能体综述的ASI之路
普林斯顿大学等机构研究者发布首个自进化智能体综述,为领域建统一理论框架和路线图。综述给出形式化定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。
视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相
中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。
金融版 Claude Code
Dexter 是自主运行的金融研究智能体,类似金融版 Claude Code。能处理复杂金融问题,有智能任务规划等核心能力。文章介绍其先决条件、安装、运行、评估、调试方法及项目地址。