「多任务训练」共找到 6617 篇相关文章
万卡时代,企业需要怎样的算力集群?
过去两年,AI算力需求跃升,消耗从训练主导转向推理驱动。企业算力需求有突发性等特点,智算集群是关键方案。InfoQ联合腾讯云发起直播探讨,还介绍了算力供给缺口、集群构建交付、性能优化及演进方向。
首钢园变身机器人大世界
近日在北京首钢园举办的机器人产业生态峰会暨投资人大会上,超50家机器人企业携创新产品亮相,展示了机器人在工业、医疗、服务等多场景的实际应用,如宇树科技四足机器人用于电力巡检等。
华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一
当前传统 MoE 有专家激活不均衡问题,华为盘古团队提出 MoGE 解决。基于此架构的盘古 Pro MoE 大模型在昇腾集群高效训练,推理性能强,在 SuperCLUE 榜单千亿内模型并列国内第一,赋能业务落地。
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
一句话搭出9人旅行网站!奥特曼:ChatGPT Work名字起小了
7月26日深夜,奥特曼称用手机让ChatGPT安排长周末旅行,指令跑完了。ChatGPT Work能力强,能处理多种任务,横跨检索、建站等活儿。其底层是Codex技术,有插件、Sites等能力,还能处理家务。
刚刚,Fable 5全球复活!限时7天,额度砍半
Anthropic官宣Fable 5回归,7月1日至7日限时开放,顶配套餐周使用额度砍半。虽更新安全防护,多数编码任务不受影响,但新防护有误伤,且Token消耗快,还拒绝部分正常提问。其自动化率显著提升。
当我把 AI 变成一个"算法":Skill 工程化设计的心路历程
作者分享将 Agent 工程化设计的历程。指出 LLM 做 Agent 有痛点,引入 CLI 接管确定性任务和上下文管理,还设计了 Workflow 串联工具,实现自动扩展和无缝互转,最后做 workflow - creator 形成自洽闭环。
π0.7来了!涌现出组合泛化、跨本体迁移能力,VLA又行了?
具身赛道玩家 Physical Intelligence 发布新模型 π 0.7,它展现出组合泛化和跨本体迁移能力,还能通过知识蒸馏学会优化技巧。其强大源于杂数据和细提示,未来有望解决复杂任务。
Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。