「大语言模型推理」共找到 8333 篇相关文章
Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug
Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。
字节暂停 Seedance2.0 全球发布,回应武汉全员被裁;曝梁文锋将携 DeepSeek V4 撞上姚顺雨;央视 315 曝光黑灰产“养号工厂” | AI周报
本期 AI 周报涵盖多领域动态。模型方面,DeepSeek-V4 将上线,姚顺雨将发布混元新模型;字节因版权纠纷暂停 Seedance 2.0 全球发布。企业动态有腾讯云模型调价、微信研发自有模型等,还有多起融资、收购事件。
刚刚!Qwen3深夜升级,碾压Kimi K2和DeepSeek V3
通义千问更新旗舰版Qwen3模型,推出Qwen3 - 235B - A22B - Instruct - 2507 - FP8。新模型通用能力显著提升,在多测评中超Kimi - K2等模型,还增强多语言覆盖等性能,已在魔搭和Hugging Face开源。
ChatGPT最强网络安全模型,逼谷歌紧急修漏洞!
OpenAI推出安全专用模型GPT-5.6-Cyber,用于处理信息安全任务。它战绩斐然,发现诸多内核漏洞。Daybreak计划为安全人员提供工具。该模型虽有不足,但展现出强大的网络安全能力。
余家辉交卷!Meta MSL连发图像/视频模型
Meta MSL由余家辉带队发布图像模型Muse Image,开启视频模型Muse Video预览。Muse Image表现出色,采用独特创作流程,能与Muse Spark联动,有多种实用功能;Muse Video待改进,将未来几月推出。
20岁了!劈柴哥发帖庆生:谷歌翻译换了4代AI,第一次有了「呼吸感」
4月28日,Google Translate满20岁,Pichai发帖纪念,回顾其技术发展,从统计模型到神经网络,再到Gemini原生语音模型,Translate不断进化,能保留语调和节奏,虽被大模型抢风头,但仍在持续进步。
全球功能最全的视频生成模型来了
阿里发布新一代通义万相2.6系列模型,是全球功能最全的视频生成模型,覆盖文生视频等多种模式。它在视频创作和文生图方面能力提升,虽有小瑕疵,但日常短视频和二创已可用。
医疗AI迎来大考!南洋理工发布首个LLM电子病历处理评测 | AAAI'26
南洋理工大学研究人员构建EHRStruct基准,涵盖11项核心任务、2200个样本,用于评测LLM处理结构化电子病历的能力。研究发现通用大模型优于医学专用模型,提出的EHRMaster框架与Gemini联合后性能超现有模型。
UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。
Meta新研究:字节模型蒸馏后,天花板破了
本文介绍Meta FAIR与华盛顿大学合作的最新研究,针对传统大模型蒸馏Token候选空间大、存储成本高的痛点,提出字节级蒸馏方案,验证其可突破Token天花板提升模型能力上限。