多任务训练」共找到 6662 篇相关文章

产品应用8

企业级AI Coding的落地方法,都在这本实战手册里了|甲子光年

春节后字节上线TRAE企业版SOLO模式,发布《2026企业级AI编程实践手册》。TRAE企业版SOLO模式有自主规划、工具集成、任务并行等能力。手册沉淀字节经验,提供方法论和场景实践,助企业迈入AI原生软件工程时代。

甲子光年
算法论文7

大模型的第一性原理:(三)信息论篇

本文从信息论角度解读大模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释大模型底层原理,还阐述大模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
开源动态7

OCR又出宠OpenDoc,速度超MinerU6倍

复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是超轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。

CourseAI
开源动态8

5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力

2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在任务有出色表现。支持模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。

五源资本 5Y Capital
算法论文8

必须得让AI明白,有些不该碰的东西别碰(doge)

近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在基准测评中优势明显。

量子位
新闻资讯7

老外傻眼!明用英文提问,DeepSeek依然坚持中文思考

DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。

机器之心
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在项测试中的亮眼成绩。

InfoQ
开源动态8

8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉

行业首个具备“高刷”视频理解能力的模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。

量子位
开源动态7

智谱开源GLM-4.5工具调用超越Claude Opus 4.1,成本仅1.4%

开源模型GLM-4.5在伯克利工具使用榜单上超越Claude Opus 4.1,运行相同任务成本仅为1.4%。它采用MoE架构,在场景表现卓越,推理速度快,成本低,还接入款主流编程工具。

量子位
新闻资讯7

马斯克终于成『AI No.1』,6大案例看实力与水分

马斯克发布Grok 4,宣称其超越OpenAI等LLM。它屠了各种榜单,但Grok系列口碑欠佳。文中通过案例测试,展现其在各方面的表现,如编码、数学、图像等,还提到了API速度和价格。

鲸选AI