「测试用例生成」共找到 3678 篇相关文章
The Batch: 845 | 没有理由的“推理”
研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。
MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding
文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。
ICLR 2025 Oral | LLM也有从众心理!
浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。
AI公司最赚钱的生意,还是卖广告
2026年Q1财报显示,AI浪潮下广告仍是最赚钱业务。Meta的AI广告工具年化营收超600亿美元,超过OpenAI和Anthropic收入之和。广告变现路径短,AI放大其效率,OpenAI也开始测试广告。
SGLang Hierarchical Sparse Attention 技术深度解析
阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。
谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体
谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。
反击AI论文!arXiv每年拒掉2%造假内容,自动化工具加入审核
AI生成论文泛滥,arXiv等预印本平台升级审核机制,用自动化工具检测。Nature发现每年约2%论文因AI使用被拒,如bioRxiv等平台每天拒绝不少AI手稿。平台既要防造假,又要避免误伤合理AI润色。
刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4
LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。
大模型全面爆发,所有榜一都是Gemini!谷歌一夜站到了台前
北京时间今日凌晨,Google I/O 2025 开发者大会开启。谷歌发布或升级系列 AI 工具与服务,如升级 Gemini 模型、推出编程智能体 Jules 等,还展示视频图像生成模型、搜索与购物模式升级,展现其在 AI 应用领域强势回归。
Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里
Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。