「大模型推理系统」共找到 9204 篇相关文章
夸克高考,背后藏着的其实是垂类场景「深度研究」方法论
夸克早在2019年就提供高考志愿填报服务,今年推出“志愿报告”功能。其“志愿报告”Agent已生成超1000万份报告,采用PDCA模式给出指导。夸克构建可信度体现在数据库和自研模型上,还降低了幻觉率。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核
近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。
智能体时代,人类与AI如何分工?
本文围绕智能体时代人类与AI的分工展开,探讨工作模式、技能需求等变化。指出智能体使工作时空重构、原子化,挑战传统职业身份,还使工作与生活边界模糊,同时强调人类需掌握系统思维等元技能与智能体协作。
MinerU又开源了!这次专治OCR跨页失忆症
文档解析领域,MinerU团队开源了专门给OCR结果做“后处理”的4B小模型MinerU - Popo。它能把碎成一页一页的OCR结果重新拼成文档级结构,解决了当前OCR跨页逻辑断裂问题,且效果和成本优势突出。
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
“天下苦CUDA久矣!”KernelCAT率先掀桌,实现国产芯片无痛适配
中国AI产业与英伟达GPU及CUDA生态深度依赖,国产AI根基脆弱。KernelCAT作为AI Agent,能开发高性能算子,在昇腾芯片调优测试中表现出色,还能让国产模型在昇腾芯片上高效部署,实现35倍加速。
软件开发人员认为无需关注却可能会影响其工作的那些事
在哥本哈根Goto大会上,Holly Cummins呼吁开发人员关注常被忽视却影响工作的问题。她以眼镜蛇问题等为例,强调设计决策可能有意外后果,提倡系统思维、统计素养,还提及并发技术和AI对就业市场的影响。
实测可灵O1,AI视频界的Banana也来了。
可灵推出全新多模态视频大模型可灵O1,融合多种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。