全场景」共找到 3481 篇相关文章

开源动态8

「0污染」LLM理解基准来了!20000道题14个学科覆盖,来自微软

MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。

新智元
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。

Founder Park
新闻资讯7

特朗普「政府AI计划」竟在GitHub泄密!或于7月4日「独立日」上线

特朗普政府AI计划未亮相就在GitHub泄露。ai.gov网站或7月4日上线,要将AI融入政府各部门。该计划由TTS老板Thomas Shedd提出,不过网友质疑其可行性与安性。

新智元
新闻资讯8

震撼网,AlphaEvolve矩阵乘法突破被证明为真!开发者用代码证实

开发者用Claude写代码证实谷歌DeepMind的AlphaEvolve求解矩阵乘法的突破为真,它将4×4复数矩阵计算次数从49次减到48次。小哥测试代码各项指标与论文报告一致,还上传到GitHub。

新智元
新闻资讯7

刚刚,ICML 2025录用结果公布!好评论文惨遭拒,审稿人敷衍引网怒喷

ICML 2025录用结果公布,共提交12107篇有效投稿,3260篇被接收,录用率26.9%。此次评审质量遭热议,出现审稿人敷衍、评审错误等问题,同时展示了部分网友的论文录用和拒稿情况。

新智元
新闻资讯8

“毋在浮沙筑高台”:汪源谈智能体想从 80 分跨到 90 分,卡在上下文

前网易副总裁汪源在2026奇点智能产品大会分享,指出智能体系统瓶颈正从模型能力、Harness工程,转移到上下文。他还介绍了做好上下文基础设施的要点,以及推出的新内容格式KRL。

AI科技大本营
推荐文章7

对话灵感实验室:帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
8

网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030

文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。

AI科技评论
开源动态8

一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,网直呼疯狂

新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。

新智元
新闻资讯7

网都在扒的小米MiMo团队,几乎被“北大学子”承包了

小米MiMo-V2-Pro模型登上OpenRouter调用量榜单第一后,网友关注其团队。该团队成立一两年冲到顶尖,核心作者多来自北大,技术理念受小米产品基因驱动,成功是多重因素叠加结果。

量子位