「代码大模型」共找到 9950 篇相关文章
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。
刚刚,LeCun团队开源首款代码世界模型!能像程序员一样思考的LLM来了
Meta官宣发布代码世界模型CWM,将世界模型引入代码生成任务。它基于编程和世界建模数据训练,能模拟程序执行与交互。在编程基准测试中表现不错,算是Meta的概念验证,目前可看作Demo。
单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地
3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方面表现出色,超越部分千亿级大模型,还推出“大模型+小模型”协同架构释放企业算力价值。
DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!
DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
IEEE TVCG | 告别写代码!MoGraphGPT:基于模块化大模型与图形控制的2D交互场景创作
香港多所高校研究团队提出 MoGraphGPT 系统,结合上下文感知模块化大模型与图形化控制,能让用户零代码搭建 2D 交互场景。该成果被 IEEE TVCG 录用,还对比实验验证其优势。
英伟达帮你省钱,让大模型推理「短而精」,速度快5倍
过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型。
全新OCR将图片变代码无损重绘!华中科大&小红书发布3B模型,图形重建超越Gemini 3 Pro
华中科技大学与小红书联合推出MOCR,提出「解析一切」新范式,将文档图形升级为「一等解析目标」。它解决传统OCR短板,在文档解析和图形重建表现出色,还革新评估方法,代码和模型已开源。
国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型
中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。
从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍
10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。