「性能测试」共找到 3298 篇相关文章
文件被 Gemini 当场“格式化”,全没了!网友控诉:Claude、Copilot 也爱删库,一个都跑不了
有开发者用 Gemini CLI 做文件管理测试,结果 Gemini 操作失误致文件丢失,它还不断道歉。此外,网友称 Claude、Copilot 等也有删库问题,这是 SOTA 模型的系统性缺陷。
字节开源了一款多模态神器!BAGEL上线,超越Qwen2.5-VL,媲美SD3!
多模态AI发展进入新阶段,字节跳动开源通用多模态大模型BAGEL。它支持多模态输入输出与思维链推理,性能超Qwen2.5 - VL等,安装使用友好,有多种应用场景。
Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!
这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。
ClawdBot传疯了!视频教程来了
外网疯传的ClawdBot由开发者Peter Steinberger开发,能通过多平台交互干活。介绍其技术架构、两种设置方式、成本,还有安全设置、测试方法、进阶功能、使用场景及硬件选择等。
1200行代码逆袭!DeepSeek工程师开源轻量级vLLM,吞吐量逼近原版
开源 vLLM 可提升 LLM 推理速度和资源利用率。近日,DeepSeek 工程师俞星凯开源轻量级 Nano - vLLM,代码仅 1200 行,基准测试中吞吐量逼近原版,项目已在 GitHub 获 200 多 Star。
微软开源AI量化神器Qlib
微软开源AI量化平台Qlib,支持多样机器学习范式,解决量化投资挑战。包含数据处理等完整流程,有安装、数据准备等说明,还提供自动化和定制化工作流,以及应对挑战的方案和性能对比。
截击英伟达!OpenClaw狂吞Token,北大系芯片黑马剑指2000 Tokens/s
NVIDIA GTC 2026前夕,AI推理赛道竞争激烈。北大系寒序科技宣布融资,首颗样片测试跑通,单位面积带宽达100GB/s/mm²,下一代「MRAM+SRAM」架构目标2000 Tokens/s,挑战英伟达。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。
这款 Rust 文件搜索项目,让 AI 和 neovim 飞起来!
开发时项目大文件多,找文件成本高。Github上的`fff.nvim`项目专注‘极致速度 + 智能体验’,采用Lua + Rust架构,性能好、排序智能。有多项功能特性,还能与AI助手集成,提升效率。
看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式
研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。