训练数据污染」共找到 3962 篇相关文章

算法论文8

ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力

最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。

机器之心
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
新闻资讯9

清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5

UIUC学者联合清华初创团队Astraculum,围绕LLM部署阶段持续学习问题展开研究,提出Social World Model框架,基于预测市场数据测试,经自蒸馏的7B模型击败了GPT-5.6等多款前沿大模型,还搭建了专用MLOps引擎TrajOps。

机器之心
产品应用8

Qwen3.8-Flash:全新架构,更强更稳更划算

本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。

千问大模型
新闻资讯8

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段。

DeepTech深科技
产品应用7

在腾讯、育碧的做过游戏后,他转身做 AI 原生游戏,一上线就好评如潮

AI 原生游戏「动物去哪儿」基于真实地理数据,让玩家的小动物开启真实旅行,经历随机事件。创始人太一曾在腾讯、育碧任职,受 AI 启发制作此游戏。目前游戏在观猹获 9.1 分,本周五将邀太一直播答疑。

特工宇宙
新闻资讯7

英伟达和AMD,开始争夺AI制药的计算入口

每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。

DeepTech深科技
新闻资讯7

Karpathy:大模型交互的第三种范式来了?这是不是夸大其词

Anthropic 上线 Claude Tag,可让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是大模型 UI 第三次大改,但评论区有质疑,不过有大咖背书或成‘数字员工’。

AI工程化
新闻资讯8

30万被引的AlphaGo之父,创业4个月融资近百亿元!笃信RL实现ASI

4月27日,AlphaGo之父David Silver创办的Ineffable Intelligence获11亿美元种子轮融资,投后估值51亿美元。该公司押注强化学习和自我经验学习,试图挑战大模型主线。未来或采用大模型预训练和强化学习混合路线。

新智元
开源动态7

Karpathy用「harness」彻底终结了RAG。

假期时Karpathy提出llm.wiki想法引发关注。它是元框架,定义人类与AI协作管理知识的方式。与RAG不同,它将新材料关键信息编入已有wiki并持续维护。作者用多种数据测试,发现TextIn API解析效果好,还优化处理流程提升质量。

探索AGI