「AI测试集」共找到 10975 篇相关文章

算法论文8

别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」

浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。

AI科技评论
算法论文8

边画边想!多模态Reasoning迎来巨大提升!

论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。

深度学习自然语言处理
产品应用7

太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%

在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。

PaperAgent
新闻资讯7

退钱!Claude 4.8连夜大降智,GPT-5.6算力遭「腰斩」

最近AI社区遭遇集体降智潮,OpenAI疑似暗中开启GPT - 5.6灰度测试,克扣用户思考预算;Anthropic的Claude Opus 4.8被曝断崖式降智,性能不如旧版。或因SpaceX上市抽干流动性,巨头降本增效。

新智元
算法论文8

让LLM扔块石头,它居然造了个投石机

港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
新闻资讯7

OpenAI员工爆料:已抢先体验GPT-5!7月上线,疑似完全多模态

新智元报道,X上神秘爆料与网友灰度测试经历让GPT - 5讨论再升温。奥特曼称今年夏天可能推出,迈向完全多模态。此外,还提及OpenAI核心团队动态、出走高管新动作及AI发展风险与监管建议。

新智元
推荐文章7

OpenAI 开发者的 Skill 经验:如何使用评估系统来优化 Skill

文章聚焦 OpenAI 开发者优化 Skill 的方法,指出迭代 AI 技能效果难测,可借助评估系统。介绍了用 Codex 评估的流程,包括明确标准、创建技能、手动触发找漏洞等,还提及不同阶段的评估重点和工具。

特工宇宙
开源动态8

英伟达巧用8B模型秒掉GPT-5,开源了

英伟达携手港大开源Orchestrator-8B小模型,在HLE测试中分数超GPT - 5,成本低且速度快。它靠ToolOrchestra训练法,协调工具解题。此赛道已有多项研究,小模型实用优势明显。

量子位
新闻资讯8

Chiplet(芯粒) —— 后摩尔时代的芯片“乐高”玩法

当单芯片逼近物理极限,Chiplet技术应运而生,它将大芯片拆分成小芯片,通过先进封装技术整合。该技术成本低、良率高,应用场景多元,但面临热管理、测试和标准统一等挑战,未来发展前景广阔。

芯师爷
算法论文8

首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解

人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。

量子位