「模型不可知」共找到 8491 篇相关文章
DeepSeek、智谱被曝造芯,国产大模型绕开英伟达!
据路透社等爆料,DeepSeek与智谱AI正秘密自研定制化AI芯片,目标是摆脱对英伟达等的硬件依赖,构建自身算力生态。因算力账本和外部环境压力,两家公司选择研发面向推理场景的芯片。
Skills vs MCP,谁才是「大模型的 HTTP 时刻」?
近期,Anthropic新推Claude Skills获好评,而MCP协议一周年却很寂静。文章探讨MCP定位、适用边界及潜在价值,分析其与Claude Skills的关系,指出MCP生态现状及适用业务场景。
ROLL:面向大规模语言模型的高效强化学习框架
本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。
突发!Claude 4.5 发布,这次更新不止是模型!
Anthropic发布Claude 4.5,在编程等任务中表现优于GPT - 5。Claude Code升级,API添新功能,模型能力提升,对齐性改善。还推出Claude Agent SDK及“Imagine with Claude”功能。
大模型幻觉检测新方法:实时高亮不确定内容
来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。
龙虾部署不求人,还附5个OpenClaw必备技能
OpenClaw火爆带来新商业模式,新手5分钟可上手,官方推荐一行命令安装。文章介绍其5个实用技能,包括Tavily Search、n8n Workflow Automation等,还给出办公、科研党使用方案。
Ilya罕见发声:大模型「大力出奇迹」到头了
Ilya大神在近2万字采访中称,AI正从「规模时代」走向「科研时代」,主流「预训练 + Scaling」路线遇瓶颈。他还探讨了AI泛化、安全对齐、预训练范式等热门话题,给出独特见解。
大模型系统提示词逆向(2)—— Cursor
作者研究大模型提示词注入时,用简单提示词“骗”出 Cursor 系统提示词。文中分析提示词生效原理、对 Cursor 有效的原因,还提及提示词泄露的安全问题及开发者应对建议。
多智能体大语言模型中的人类自适应协作
尽管大语言模型有进展,但纯自治多智能体系统有局限。为此提出 HILA 框架及双环策略优化机制,结合 DLPO 的 HILA 在基准测试中表现出色,为构建 Agentic 系统提供指导。
Google发布"Nano Banana"图像生成模型,号称全球第一
Google推出新图像生成和编辑功能,社区称其为‘Nano Banana’,号称‘世界第一’且免费开放。它有风格转换、背景编辑等亮点,用户反馈整体积极,但也存在API限制等问题,与对手有差距也有优势。