「功能测试」共找到 3128 篇相关文章
Fable 5手搓首个CUDA「超级内核」!2.5小时狂飙18.7倍
在GPU算子基准测试KernelBench - Mega中,Fable 5全程纯手搓CUDA,速度狂飙18.7倍,把GPT - 5.5甩开4倍多。它写出史上首个‘超级内核’,2.5小时约55万token完成编写。Anthropic联创称这标志‘RSI循环’开启。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
沃顿教授警告:老板用AI正偷偷赚钱,而你还在审它做的17份PPT?
AI跨越关键门槛能完成有经济价值的工作,但也可能产生大量无用内容。OpenAI新测试显示大模型进步快,虽暂难取代人类工作,但智能体工作续航能力大增,人类对其使用方式决定未来。
PolarDB Supabase Edge Functions - 让函数,随时可用
文章介绍 PolarDB Supabase Edge Functions,它是为全栈应用打造的边缘计算方案。提供 CLI 和 Studio 两种开发方式,补全开源版缺失的管理后台,让企业能兼顾功能与控制力,还提及数据库原生多模态智能检索方案。
一分钟做3D音符版“跳一跳”,Flowith成通用Agent新“必玩王者”丨TIP 003
Flowith作为较早出海的AI产品,以自由画布+通用Agent组合出圈。其Neo版本技术功能强,产品服务有亮点,如不限DeepResearch任务、以人为主的智能代理、回答速度快等,虽有不足但未来值得关注。
我的 AI 原生开发流程:一个真实案例的完整复盘
作者复盘用 AI 给 App 加新功能的开发流程,指出 AI 原生开发本质还是传统流程,但执行主体从人变成 Agent,人是指挥官,确认决策;各环节有变化,文档更重要,大部分开发类 Skills 没必要。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
500行极简开源框架,硬刚GPT/Gemini视觉极限!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。
开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台
Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成全栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。