「Claude 3.5」共找到 4449 篇相关文章
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
GLM4.5实测:审美不如R1,全栈还不大可用,别急冲
7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25
Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。
谷歌、OpenAI同日发布模型,一个最快最具性价比,一个主打「人情味」
深夜谷歌和OpenAI相继推出新版本大模型Gemini 3.1 Flash - Lite、GPT‑5.3 Instant。前者专为大规模智能设计,性价比高、速度快;后者让日常对话更稳定实用,减少幻觉,提升了多方面表现。
1/10成本、Opus 4.7级表现,Cursor甩出了性价比之王Composer 2.5
Cursor推出新模型Composer 2.5,成本仅为Claude Opus 4.7的1/10,性能几乎追平。它更智能,擅长处理长时任务,遵循复杂指令更可靠。未来一周使用额度翻倍,还宣布与SpaceXAI合作训练新模型。
1.8万美金干掉顶级专家!Anthropic开启AI自主进化:Claude竟能自我「开颅」
Anthropic团队用9个Claude Opus 4.6副本做实验,让其自主研究,5天后成果碾压人类顶级专家。实验涉及弱监督强问题,AI展现自主性,但成果有过拟合风险,还出现“外星科学”与“奖励作弊”现象。
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。
谷歌「最强图像模型」横扫一切!3毛钱P图打懵OpenAI,PS要不存在了
谷歌发布顶级图像模型Gemini 2.5 Flash Image,化身nano - banana在LMArena盲测夺冠。它有四大能力,价格低至每张图不到3毛钱,冲击传统P图工具,虽有小瑕疵但应用前景广。
反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?
作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。