「测试时扩展」共找到 2641 篇相关文章
谷歌Gemini-0605发布,全球大模型第一!
昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。
吴恩达手搓新项目:AI审稿人上线!只为终结学生“3年被拒稿6次”的痛苦
吴恩达开发新项目 Agentic Reviewer 代理审稿人,灵感源于学生3年论文被拒6次。此工具能加快研究人员迭代速度,在 ICLR 2025 评审数据测试中接近人类水平,适用于 arXiv 公开研究领域。
深度拆解,硬核解构,揭开vLLM推理系统实现高效吞吐的秘籍
文章深度拆解 vLLM 推理系统,介绍其核心组件和高级特性,包括推理引擎流程、调度机制、高级功能等,还提及系统扩展、分布式部署、性能测量等内容,助力读者理解推理引擎工作原理。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!
Selenium 编写 Web 自动化脚本痛点多,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸多问题。它功能强大,安装使用简单,适用于多场景,像“智能助手”让自动化测试变简单。
Anthropic发布Claude Science,AI开始像研二学生一样做科研
当地时间6月30日,Anthropic发布科研产品Claude Science。它运行Claude Opus 4.8,亮点在使用方式,将科研所需整合,还能拆分任务。早期用户反馈良好,与OpenAI、谷歌竞争,已开放测试版。
The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。
MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩
2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。
这个框架让大模型省下50%内存,合并专家不如直接删掉?
Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。
OpenAI宣布推出AI在线招聘平台,和微软的领英打起来了
OpenAI计划2026年推出AI在线招聘平台OpenAI Jobs Platform,借助AI匹配企业需求与员工能力,将与微软领英竞争,还与多机构合作,同时扩展学习平台并推认证课程。