「数据质量评估」共找到 3466 篇相关文章
清华&通院推出"绝对零"训练法,零外部数据大模型自我博弈解锁推理能力
清华、北通院和宾州州立大学研究人员提出“绝对零”训练法,让大模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。
AIAA J | 香港理工大学王旭等:目标导向的特征提取-以特征构建增强数据驱动模型
该论文通过对比学习理清潜在输入特征与目标输出的关联性,提出输出驱动的输入特征构造方法。所构造特征在高维代理模型构建中增强效果显著,还可减少预测误差分布及不同模型收敛性和鲁棒性差异。
狂涨 17.7K star!!智能查询导入、数据可视化、AI 迁移,这款开源数据库图表工具火了!
日常开发中,数据库设计和管理工作繁琐易出错。本文介绍超实用开源项目 ChartDB,它能将数据库结构可视化,AI 帮导出 SQL,有一键导入、AI 驱动导出等特性,开源免费,多种方式安装。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF
MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
4个月融进1亿美元、建齐3座「数据发电厂」,这家TechBio要造一个生物世界模型
原生AI TechBio公司寻明生科4个月融1亿美元,欲搭建横跨数字与生物世界的药物发现基础设施。其聚焦抗体药物设计,构建干湿实验闭环,推出AuraIDE和OpenDDE,采用“既卖引擎,也卖车”商业模式。
极客部落“OPC 创业者招募计划”正式启动 —— 携手朝阳区赋能 AI 时代独角兽,助推人才高质量发展
北京市朝阳区多部门与极客邦共同发起“极客部落·AI 应用生态园”及“OPC 创业者招募计划”,为创业者提供全方位加速支持。“朝阳青创十五条”涵盖多维度政策,3 月 20 日还有创业开放日活动。
Anthropic扒了Claude的数据,发现一个残酷真相:越拥抱AI的人,越先被AI干掉。
Anthropic研究报告显示,越拥抱AI的行业越先被AI替代,如程序员、客服等岗位渗透率约70%。虽目前未大规模失业,因理论与实际渗透有差距,但随着阻力被击破,失业率恐上升,年轻人入职率已受影响。
谷歌突砍Gemini免费版炸锅,数据养模遭背刺?GPT-5.2突袭Gemini 3,Demis Hassabis:谷歌须占最强位
近日谷歌收紧Gemini API免费层级限制,引发开发者不满。同时,OpenAI计划提前发布GPT - 5.2竞争。谷歌DeepMind的Hassabis表示要与OpenAI竞争到底,对Gemini 3满意,还介绍了谷歌未来三个主打方向。