「自演进评测」共找到 1878 篇相关文章
GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了
GPT-5.2登场,有即时版、思考版与专业版。它在多方面大幅升级,能碾压44类专业工作。经济性强,编程能力佳但速度慢,还自评‘最优科研模型’,幻觉现象减少。今日起推送,优先面向付费用户。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
英伟达的局:狂撒15亿美元,从Lambda那租到了搭载自家AI芯片的GPU服务器
据The Information消息,英伟达与小型云服务提供商Lambda达成15亿美元合作,租赁其搭载自研AI芯片的GPU服务器。这并非首次,此前已对CoreWeave如此操作。目的是维护其在云计算市场的主导地位。
Anthropic 完成930亿元 F 轮融资,投后估值达 13096亿
Anthropic 宣布完成由 ICONIQ 领投的 130 亿美元 F 轮融资,投后估值达 1830 亿美元。众多顶级投资机构参与,自推出 Claude 模型后增长飞速,业务覆盖多领域,资金将用于扩产、安全研究和国际化。
毕树超入职Meta后首发声:十年前怀疑AGI,如今深信AGI已至!
Meta超级智能团队成员毕树超回溯70年AI进化,称多数人低估AI影响,从怀疑到深信AGI已至。他阐述技术进展、难题与趋势,分享研究心路,回顾自监督学习、强化学习等发展,打破诸多机器学习误解。
1.93bit版DeepSeek-R1编程超过Claude 4 Sonnet,不用GPU也能运行
1.93bit量化后的DeepSeek - R1(0528)编程能力超Claude 4 Sonnet,在aider榜单获60分。Unsloth工作室制作9个量化版本,小版本不用GPU也能跑。R1 - 0528在游戏评测中表现也佳。
小米的中国芯,与雷军没说的“四个秘密”
本文围绕小米玄戒芯片展开,介绍其推出背景、工艺选择、研发成本及应用前景。指出华为、OPPO调整业务给小米带来契机,3nm工艺因品牌与成本平衡成首选,还分析了自研成本和知识产权等挑战。
单机H200最快DeepSeek V3和R1推理系统优化秘籍
作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。
OpenAI曝出第一颗芯片叫「辣椒」!AI自己设计,9个月流片
OpenAI首颗自研芯片Jalapeño问世,9个月从白纸到流片,创行业最快纪录。该芯片专为大模型推理设计,由其AI参与设计优化,有望降低推理成本,提升用户体验。OpenAI欲做全栈AI公司。
WorkBuddy杀疯了?一群AI专家帮我打工,我在微信里当赛博虾工头!
本文介绍腾讯推出的全场景职场AI智能体桌面工作台WorkBuddy。它内置多领域垂类专家,能接管自媒体内容创作流水线,还接入微信ClawBot插件方便操作。部署和技能配置门槛低,内置主流模型,还有免费Credits福利。