「可迁移模型」共找到 9915 篇相关文章
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。
解码加速15倍!EdgeRazor助推大模型在PC/移动端“狂飙”
大语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京大学和微软联合推出,采用MPQAD打破极低比特大语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。
“煽风点火”让大模型“卷”起来的提升性能的套路
网友Greg Isenberg分享让AI提升性能的方法,通过利用不同AI模型如ChatGPT、Claude、Grok间的“竞争”,人为制造竞争环境,激发其潜力,可提升输出效果,且方法获很多网友验证认可。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
14K Star!统御万模的 AI 聚合网关,一个 API 管理所有大模型!
文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。
最具争议性研究:大模型中间层输出可 100% 反推原始输入
意大利罗马第一大学GLADIA Research Lab论文提出主流Transformer语言模型信息处理几乎不丢内容,是可逆的。实验验证其单射性,SIPIT算法能100%重建输入。研究有新视角,但也引发讨论。
手机也能跑,腾讯混元一口气开源4款小模型
腾讯混元团队开源4款小模型,最大7B。可在低功耗场景运行,支持微调。是融合推理模型,有快、慢思考模式,在多领域表现出色,亮点是agent和长文能力,已落地多元业务场景。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
Stripe 的零停机数据转移平台以毫秒级流量切换迁移 PB 级数据
在旧金山 QCon 会议上,Stripe 工程师介绍零停机数据转移平台,能 PB 级数据库迁移,流量切换毫秒内完成,支持每秒 500 万次查询和 99.9995% 可靠性。还讲了迁移六阶段及多用途。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。