「训练方法」共找到 3293 篇相关文章
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
OpenAI「解决」10道数学难题?哈萨比斯直呼「尴尬」,LeCun辛辣点评
OpenAI研究员宣称GPT - 5「发现」10个悬赏数学难题的解决方法,舆论误以为是解题方法,后发现只是检索到已有文献,引发学界大佬群嘲和对AI夸大宣传的讨论。
可能是目前效果最好的开源生图模型,混元生图3.0来了
腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。
科研写作神器,超越Mathpix的科学公式提取工具已开源
LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。
狂涨91.4K star!!号称是下一代Vim编辑器,体验超棒!
本文介绍开源项目Neovim,它是Vim分支,扩展性强、好用,内置终端模拟器,支持图形界面,与Vim插件兼容性好,还介绍其性能特色、安装配置方法及常用命令。
AI破译生命!微软蛋白质研究「超级加速器」登上Science
微软研究AI for Science团队推出BioEmu,能模拟蛋白质在平衡状态下的各种可能结构集合。它输入蛋白质序列就能生成大量结构样本,预测性质,速度比传统方法快10万倍,已开源助力药物研发。
模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理
具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。
吴恩达分享AI开发项目快速实践大法
吴恩达指出很多AI开发者总觉得没时间开始构建应用,他给出的解决办法是把项目范围缩小,直至能在一小时内完成。他还分享周末项目实例,说明削减范围实践的好处。
大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单
蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。
ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统
复旦大学团队主导的BookWorld系统,是ACL 2025论文成果。它能从小说提取数据构建AI世界,让角色AI互动创作故事。系统有自主和干预模式,实验表现出色,未来可成互动娱乐平台。