传统软件测试」共找到 3159 篇相关文章

7

被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了

被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。

量子位
新闻资讯7

Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口

Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试

AI工程化
产品应用7

用Claude Code搭建工作流

作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。

newtype AI
开源动态8

利用大模型从开源情报中自动提取检测规则:LLMCloudHunter,有开源

随着网络攻击增加,威胁情报成主动安全关键。以色列本古里安大学发布LLMCloudHunter框架,用大模型从开源情报自动生成检测规则,评估显示其规则质量高,且大部分能编译成Splunk查询,软件已开源。

AI与安全
算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

ICLR 2025 Oral | LLM也有从众心理!

浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。

深度学习自然语言处理
产品应用7

Cursor Origin 上线,GitHub 的老玩法还够用吗?

8月17日,GitHub服务异常,同日Cursor向付费计划开放Origin early beta。代码仓库接入更多Agent,现有设施适应人的节奏,而Agent工作节奏更快。Origin重写协作成本,与GitHub设计前提有差异,马斯克布局延伸到软件生产链。

AI科技评论
新闻资讯7

AI公司最赚钱的生意,还是卖广告

2026年Q1财报显示,AI浪潮下广告仍是最赚钱业务。Meta的AI广告工具年化营收超600亿美元,超过OpenAI和Anthropic收入之和。广告变现路径短,AI放大其效率,OpenAI也开始测试广告。

DeepTech深科技
新闻资讯7

中国电影资料馆成功申报《图像修复的方法、装置、电子设备、存储介质及程序产品》国家专利

日前,中国电影资料馆研发的《图像修复的方法、装置、电子设备、存储介质及程序产品》成功申报国家专利。该专利用AI模拟修复师思路,解决传统AI修复缺陷,为老电影修复提供智能精细方案,是该馆首个专利。

中国电影资料馆