「To B场景」共找到 2589 篇相关文章
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。
不靠英伟达,中科院在国产 GPU 上跑通 76B 类脑大模型
过去大模型依赖Transformer和NVIDIA GPU体系,硬件自主化难。中科院团队提出类脑大模型SpikingBrain,在超长文本处理上百倍加速,在国产MetaX GPU平台稳定训练76B模型,开辟新道路。
OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!
现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。
字节跳动开源视频生成模型Alive:12B参数,个人电脑也能跑
字节跳动开源视频生成模型Alive,12B参数,支持四种模式,硬件门槛低。在评测中表现出色,技术架构精心设计,解决音视频同步等问题,虽有小瑕疵,但更适合普通玩家。
Meta「轻量级」KernelLLM颠覆GPU内核生成,8B参数碾压GPT-4o
Meta推出基于Llama 3.1微调的8B参数KernelLLM,能将PyTorch代码转高效Triton GPU内核。实测单次推理性能超GPT - 4o和DeepSeek V3,多次生成得分更高,让内核开发更易上手。
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。
最强开源0.9B级OCR模型!本地Agent、知识库都有救了!
百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。