同质化评估」共找到 1448 篇相关文章

开源动态8

我去,Github 51k star,没看错,他是开源的,“用 Docker 运行 macOS”?你绝对没看错!

这是一个运行于 Docker 中的 macOS 虚拟环境项目。开发者或安全研究者在非 macOS 平台运行 macOS 常遇性能差等痛点,而 Docker - OSX 利用容器轻量部署,接近原生性能,功能亮点多,应用场景丰富。

小华同学ai
新闻资讯7

AI顶会反噬整个学术圈!「不发表就会死」,NeurIPS爆仓,博士年肝4.5篇大崩溃

NUS研究者指出,NeurIPS等AI顶会投稿量激增,正反噬学术圈。当前模式存在结构性危机,如学术产出泡沫、环境代价高、研究者心理负荷大等。为此,他们提出“社区联邦会议”(CFC)模型以解决问题。

新智元
新闻资讯8

Agent引爆产品新思维、奇点智能研究院正式成立!2025 全球产品经理大会首日精彩速览

8月15日,2025全球产品经理大会开幕,众多专家分享见解。奇点智能研究院成立,聚焦AI多范式转换设六大研究领域。李建忠、方汉等嘉宾探讨AI产业生态、产品创新等,还涉及GenAI交互设计、AI产品“人味”等内容。

AI科技大本营
开源动态8

JinaVDR: 一个图文混排文档搜索任务的基准集

现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。

Jina AI
算法论文7

阿里、南开大学发布免训练,视频大模型创新压缩方法

视频模型序列处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。

AIGC开放社区
新闻资讯7

The Batch: 852 | 加州重新制定人工智能监管框架

加州人工智能前沿模型联合政策工作组发布《加州前沿人工智能政策报告》,为立法者提供监管尖端AI模型的政策原则。报告聚焦前沿模型监管,提出综合多源证据、鼓励信息披露等结论,还探讨了美国AI监管现状。

DeeplearningAI
算法论文8

ICML2025 | 揭示MLLM的图文联动推理能力

当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

深度学习自然语言处理
开源动态8

伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开

开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。

新智元
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout

文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则方法,重点介绍了Dropout随机失活,还指出其局限性及在大模型中的应用策略。

AI大模型应用实践
产品应用7

回复:用 AI 辅导教学问题

家长询问用Gemini 2.5 pro的OCR功能辅助孩子预习九门课程的问题,包括撰写提示词、有无更合适AI方案、家长角色及评估学习成果等,回复给出对应建议,如没必要上传教材等。

宝玉AI