「看表测试」共找到 2204 篇相关文章
AI编码新神登基,藏师傅一手Claude 4实测
Claude 4低调发布,Anthropic称Claude Opus 4是全球最佳编码模型。发布内容含扩展思维、新模型能力等,还公布定价。Claude Opus 4编码和记忆能力强,实测表现出色,Claude Sonnet 4也有提升且免费。
震撼全网,AlphaEvolve矩阵乘法突破被证明为真!开发者用代码证实
开发者用Claude写代码证实谷歌DeepMind的AlphaEvolve求解矩阵乘法的突破为真,它将4×4复数矩阵计算次数从49次减到48次。小哥测试代码各项指标与论文报告一致,还上传到GitHub。
向量数据库要被取代?DynamoDB 开始原生支持 AI 搜索
Amazon DynamoDB 推出原生向量搜索,允许开发者将嵌入向量与应用数据存一起,直接在其中运行近似最近邻查询,无需单独向量数据库。介绍了功能特点、成本计费及开发者反馈等。
超硬核,腾讯给力!
文章介绍腾讯朱雀实验室开发的AI安全红队测试平台A.I.G,能对AI系统做全面“安全体检”,覆盖AI基础设施、MCP、LLM等风险。它功能实用,安装简单,适合折腾AI服务或MCP的人。
黄仁勋搬来华尔街5000亿,买GPU可以按揭了
8月11日,英伟达宣布与六家金融机构合作,成立算力融资平台,欲动员超5000亿美元,把算力做成可融资生意。其将英伟达全栈AI基础设施当可投资资产,客户按需付费,但英伟达股价不涨反跌,这场豪赌结果待察。
告别 LEB128 的规范性陷阱,Bijou64 用结构设计解决安全问题
研究实验室Ink & Switch发布bijou64可变长度整数编码格式,由Brooklyn Zelenka开发。它消除规范性漏洞,在基准测试中超标准标量LEB128解码器。Hacker News社区对其有权衡讨论,实现已用Rust发布。
做过十遍还要从头摸索?Agent 的记忆终于开始长成技能
MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。
Reddit一张神图疯传!2年后,你的笔记本就能跑Fable 5
r/LocalLLaMA社区一张图刷屏AI圈,显示Fable 5级AI预计2年后可在笔记本本地运行。从历史模型看,前沿能力从云端到本地约24个月。这意味着AI正从云端垄断走向桌面民主化。
LabVLA:当AI走进科学实验室,浙大x上海 AI Lab联合探索科学具身智能
浙江大学与上海人工智能实验室联合推出 LabVLA,探索更具泛化能力的科学具身智能范式。团队构建仿真数据引擎 RoboGenesis 与语料 LabEmbodied - Data,LabVLA 在多测试中表现良好,还将探索多场景应用。
Claude Fable 5重新上线!GPT-5.6秒跟
Claude Fable 5重新上线,或为小范围灰度测试。此前因出口管制停产近两周。它能力强但烧Token,社区一直盼回归。同时,GPT - 5.6在Fable 5上线后秒跟,将分批发布。