「真机测试」共找到 2125 篇相关文章
首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例
OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。
用脑机接口上班是什么体验?一个渐冻症患者使用了两年后表示:其实很无聊
加州大学戴维斯分校团队为渐冻症患者凯西植入脑机接口,装置工作 19 个月处理 18.3 万个句子,证实其长期稳定性和临床实用价值。不过,脑机接口难以兼顾多方面要求,商业推广也面临诸多门槛。
谷歌AI试穿神器真神了!上传照片秒出OOTD,视频效果和照镜子没区别
谷歌推出应用Doppl,上传照片就能看到衣服“穿”在自己身上的效果,还能生成动态视频。它不仅能试穿,还会帮忙搭配。此外,Google Labs还有Portraits、文生视频产品Flow等小实验。
GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神
GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
GPT-5.2发布即降智?背后华人被挖出,清北校友核心贡献
OpenAI发布GPT - 5.2,官方称其基准测试碾压Gemini 3 Pro,擅长完成有经济价值任务。但发布后实测有翻车情况,也有提前测试者称其很强。此外,背后多位核心贡献者为华人,如北大校友Yu Bai等。
打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年
红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。
1/3预算跑平 GPT-5?上海AI Lab「路由魔法」成本直降63%性能反涨 7%!
当前大模型需解决性能与效率平衡问题,GPT - 5用测试时路由技术初步平衡。Avengers - Pro测试时路由框架集成不同LLMs,通过嵌入、聚类、评分操作,调整权衡参数α,能依查询特征选模型,性能和效率优于单一模型。
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
刷屏的SBTI,底层算法有点东西…
近期SBTI人格测试爆火,它出自B站UP主Q肉儿串儿,初衷是劝朋友戒酒。经分析,它大概率是“人工主导+AI辅助”的产物,技术架构简单,算法逻辑是答题拆维度、分数归档、模板匹配。此外,还有大神网友推出MBAI版测试题。