「B200 GPU」共找到 1277 篇相关文章
大模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3%
上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让大模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。
给机器人打工了一天,我们体验上了AI时代最魔幻的工作。
本文讲述作者公司小伙伴达达体验给具身智能做数据采集工作的经历。具身智能数据获取难,催生数据采集员岗位。达达面试顺利,工作时先觉新奇,后感手腕酸,日薪200 - 250元,凸显AI进步背后普通人的贡献。
3亿美元薪酬被10人拒绝!OpenAI首席研究官一句话引发硅谷史上最疯狂抢人大战
据华尔街日报爆料,Meta小扎开出3亿美元“挖人费”,至少10位OpenAI员工拒绝。OpenAI首席研究官Mark Chen一句话引发抢人大战。Meta超级团队44人中,40%来自OpenAI,50%是华人。小扎承诺算力管够,逼得OpenAI将上线100万个GPU。
登顶!快手发布开源编程模型,720亿参数,创下编程能力新纪录
快手发布开源编程模型KAT-Dev-72B-Exp,在SWE-Bench Verified测试中登顶开源代码模型,与闭源GPT - 5成绩相近。该模型基于自研框架,有架构创新,还集成多种软件工程能力,是构建编程智能体的有力工具。
美团也开源了大模型,但我觉得他们的野心是通用生活Agent。
美团发布并开源560B参数的MoE模型LongCat - Flash - Chat,推理速度快。与DeepSeek V3对比,输出速度优势明显。美团多个落地或内测AI功能服务C端生活场景,目标是打造通用生活Agent。
OpenAI没开源的gpt-oss基础模型,他去掉强化学习逆转出来了
OpenAI未发布gpt-oss基础模型,Cornell Tech博士生Jack Morris自行逆转gpt-oss模型强化学习,发布gpt-oss-20b-base。该模型可生成任意文本,但不再对齐,还测试了其记忆能力,介绍了诞生原理与技术细节。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
AI Coding大佬聊透了:产品智能重要还是用户体验重要?答案让人意外
量子位举办AI Coding沙龙,百度、硅心科技等多位行业玩家参与。探讨AI编程从替代人转向协作、智能体发展、To B与To C界限模糊等话题,指出未来产品智能更重要,编程产品将服务更广人群,程序员技能需转变。
Kubernetes 被 AI 打回“半成品”!K8s 之父发出警告:代码生成越快,程序员越危险
Kubernetes联合创始人Brandon Burns表示,AI让Kubernetes回到‘未完成’状态,它得适应GPU调度等新需求。他还谈到AI对编程工作的影响,如代码审查成核心技能,未来编程语言或为AI设计。
4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?
Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。