「模型改进」共找到 7851 篇相关文章
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话
当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1,含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出不足。Windsurf称旨在提升软件开发速度,还介绍了测评、编辑器赋能等情况。
Nature公开谷歌IMO金牌模型技术细节!核心团队仅10人,一年给AI编出8000万道数学题训练
谷歌DeepMind的IMO金牌模型AlphaProof技术细节公开。团队规模小,核心成员是IMO金牌得主。它把数学证明当游戏,用30亿参数模型和改进树搜索算法。训练难题靠自动形式化解决,赛场用TTRL突破,已开放使用。
拐点出现,中国开源大模型下载量超越美国
Interconnects.ai报告显示,截至2025年8月,中国开源大模型在HuggingFace下载量快赶上美国,增长速度更快,派生模型数量增多。美国因结构、生态等问题落后,中国模型优势在于速度、迭代等。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究
当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。
终于有AI视频模型,解决了体操难题。
前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。
Anthropic "泄露"Claude Mythos 最强模型到底有多猛?
Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。
一份最新具身智能中的世界模型&安全综述
本文分享2篇具身智能世界模型和安全挑战的综述。2025年10月的综述用三维坐标轴整合文献。还介绍世界模型分类、性能表现,围绕自动驾驶与机器人领域分析安全隐患并实证评估。