「Qwen2.5-0.5B」共找到 3925 篇相关文章
企业落地 NL2SQL,需要的是 AI-ready data 和 小模型
当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
GPT-5 不是技术新范式,是 OpenAI 加速产品化的战略拐点
文章从不同视角评价 GPT - 5,指出它是 ChatGPT 产品重要升级,是 Router 驱动系统。介绍其能力提升与短板,如 Vibe coding 性价比高但 Agentic 能力不足,还探讨了商业影响、价格战等,期待其 Agentic 能力发展。
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。
面壁MiniCPM4推理速度3倍,碾压同尺寸Qwen3,阿里上眼药了~
面壁发布包含10个模型的MiniCPM4系列,其推理速度快。它有高效模型架构、学习算法、高质量训练数据和推理系统等创新点,还给出了MiniCPM4实战代码及启用InfLLM v2的参数设置。
Seedream 4.0 来了,AI 图片创业的新机会也来了
今年AI生图领域爆款不断,Google旗下Nano Banana模型虽火但中文支持欠佳。火山引擎推出豆包·图像创作模型Seedream 4.0,主体一致性强,支持4K多模态生图,有多图融合、精准编辑等能力,或给AI图片创业带来新机会。
仅凭一篇博客,他成功入职OpenAI!核心技术或用于GPT-5训练
Keller Jordan设计Muon优化器并公开研究进展,引OpenAI和xAI关注,最终加入OpenAI。Muon性能卓越,或用于GPT - 5训练,其故事暗示传统论文模式在AI领域或已落伍。
物理AI的「原生」时刻:原力灵机发布具身大模型DM0
主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。
优步凭借 CacheFront 的改进实现每秒 1.5 亿次的读取操作
优步工程师更新 CacheFront 架构,实现每秒 1.5 亿次读取操作且确保强一致性。解决了旧设计中陈旧数据读取问题,引入新协议和机制,弃用专用 API,还增强监控工具,提高缓存命中率。
我在Seko 3.0里敲了个「/」,它把导演调了出来
商汤在WAIC发布Seko 3.0,这是一个AI短剧和漫剧创作平台。它把导演变成可调用的能力,将创作者方法封装成Skill。作者通过实验对比,证实Skill核心在工作纪律,该平台还支持成片制作,且有创作者产业基地。