「Cyb5b」共找到 2493 篇相关文章
以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能
dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。
4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法
大语言模型幻觉问题是部署难题,CMU等研究人员提出行为校准强化学习新方法,重新设计奖励函数。经训练,40亿参数模型幻觉抑制力超GPT - 5,实验证明该方法效果显著,还带来理论洞察。
智谱新模型也用DeepSeek的MLA,苹果M5就能跑
智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」
文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。
寻明生科获1亿美元B轮融资,加码基座模型开拓AI药物发现新边界 | 5Y News
近日,寻明生科宣布完成1亿美元B轮融资,累计近2亿美元。资金将投入生物基座模型研发与规模化训练,升级Lab - in - the - Loop体系。该公司构建闭环AI原生基础设施,其模型能力获验证,商业变现多元。
aiX-apply-4B逆袭DeepSeek-V3.2!aiXcoder发布代码变更应用模型,单卡推理提效15倍
3月25日,硅心科技发布专为代码变更应用场景设计的模型aiX - apply - 4B。它平均准确率达93.8%,超越Qwen3 - 4B和DeepSeek - V3.2,算力成本仅为后者5%,推理速度提15倍。还采用创新训练方法,适配企业场景。
谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱
2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。
DeepSeek V4没做的,MiniCPM-o 4.5给做「全」了~
上周 DeepSeek V4 发布,遗憾不是多模态。今天 MiniCPM-o 4.5 补上短板,凭 9B 参数实现端到端全双工全模态大模型,自 2026 年 2 月发布后 Hugging Face 下载量超 25 万。还推出多项成果,性能表现出色。