「biosec基准库」共找到 1120 篇相关文章
黑客已死!Claude 两周挖出 Firefox 22 个漏洞
Anthropic与Mozilla合作,让Claude Opus 4.6对Firefox代码库做漏洞挖掘,两周发现22个漏洞,14个高危。Claude发现漏洞能力强,但利用漏洞能力弱。还研究用LLM做「补丁Agent」,为AI辅助安全研究建规范。
32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗
现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。
击败 GPT-5!理想汽车开源 RubricHub:大模型开放生成从此有了专业裁判
理想汽车基座模型团队联合高校发布RubricHub数据集,解决开放式任务评价难题。该数据集可将主观评价转化为量化标准,经其训练的Qwen3 - 14B小模型在医疗基准测试中超越GPT - 5。
Swift 跨平台框架 Skip 现已完全开源
Skip 是用 Swift/SwiftUI 代码库创建 iOS 和 Android 应用的方案,经三年开发后团队将其完全开源,此前为付费方案。开源既是因开发者希望免费获工具,也为保证工具持久性,它能实现原生体验。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。
用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源
IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。
蚂蚁再把医疗AI卷出新高度!蚂蚁·安诊儿医疗大模型开源即SOTA
蚂蚁集团联合多方开源的医疗大模型蚂蚁·安诊儿(AntAngelMed),一经发布就登顶多项医疗基准测试榜单,是迄今参数规模最大的开源医疗模型,应用门槛低,为行业示范出一条清晰路径。
142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要
文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。
以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA
Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。