「测试全流程」共找到 3890 篇相关文章
SGLang Hierarchical Sparse Attention 技术深度解析
阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。
不止是 Claude Code 平替:这个开源 CLI 还支持“多模型协作 + 子代理并行”
Kode 定位是在终端中完成代码库理解、文件编辑、命令执行等开发流程,有三大亮点:将多模型协作设为核心能力;支持 AGENTS.md 文档模式;终端体验好,有强大的补全系统。还介绍了使用方法和适用人群。
谷歌Gemini一次提示能耗≈看9秒电视,专家:别太信,有误导性
谷歌报告称处理一个中位数的Gemini文本提示能耗低,2024 - 2025年单个文本提示能耗降33倍、碳足迹减44倍,归功于全栈式优化。但专家质疑其方法论,指出未算间接用水、碳排放核算不全等问题。
谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体
谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4
LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。
Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里
Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。
一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题
DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。
养了只东北味熊猫当AI合伙人,一口一个老铁,还真帮我开了家「一人公司」
腾讯ima上线copilot模式,可“领养”小熊猫并设定人设风格,成专属知识伙伴。它不分对话和任务模式,知识库功能实用,还能私人定制。作者用它模拟创业,体验良好,其记忆和全场景感知实用。
机器人终于「懂」家务了!伯克利MomaGraph让机器人像人一样做家务
过去家用机器人做家务存在诸多难题,最近加州伯克利和马里兰大学联手推出 MomaGraph 技术。该技术采用「Graph - then - Plan」思路,团队搭建了完整体系,在星动 Q5 上测试效果好,让家用服务机器人迈向实用。