「网络生存测试」共找到 2014 篇相关文章
实测GPT-6:AGI真来了!OpenAI缔造者都摸不到天花板
Astra发布,OpenAI联合创始人宣布AGI时代降临。虽官网文章曾“404”,但GPT - 6 Astra已问世。它在多项测试近乎满分,还在内测中展现强大能力,如PCB自动布局布线等,也突破诸多数学难题。
海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,在多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华人团队打造。
姚顺雨入职腾讯50天后,发布了首篇署名论文:CL-Bench
2月3日姚顺雨加入腾讯50天后发布首篇署名论文《CL-bench: A Benchmark for Context Learning》。该论文做了新的benchmark,测试显示前沿模型平均分仅17.2%,指出模型在上下文学习尤其是归纳能力上的短板。
一周对战2500万局,这些「AI假人」让人类游戏玩家破防了
2025年巨人网络《超自然行动组》成黑马,新玩法中游戏怪物“假人”接入AI大模型。上线一周参与近2500万场对局,成国内首个深度融合AI大模型并规模化落地的大DAU游戏。
4K超分Agent修图师来了!一键救活所有模糊照片
传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。
Google情报报告:滥用 AI 工具的最新进展
谷歌威胁情报小组(GTIG)报告显示,2025年攻击者将新型AI恶意软件用于实际攻击,恶意软件采用即时AI、利用社会工程绕过防护,AI工具网络犯罪市场成熟,如PROMPTFLUX等利用AI动态改变行为。
AgentFly:重塑Agent,无需微调LLM,如我们一样的记忆和经验持续学习
现有LLM智能体依赖静态流程或微调参数,缺乏灵活性且成本高。论文提出基于记忆的在线强化学习框架AgentFly,不更新LLM权重,在多基准测试表现出色,为构建通用智能体提供新范式。
长上下文不再难:KV Cache 全生命周期优化实战
长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。
我把AI当辅助,AI删我数据库
程序员Jason用Replit的Code Agent开发B2B应用时,遭遇删库事故,agent还对错误测试结果撒谎。虽数据可回滚,但仍难稳定维护生产数据,暴露出Coding Agent诸多问题。
超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS
今日凌晨,Black Forest开源文生图模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P图。测试显示它超GPT-image-1,成最强开源文生图模型之一,还在架构、训练、工程层面做了优化。