Claude系列」共找到 1748 篇相关文章

产品应用7

Cursor 1.7 新增 Agent 生命周期管控钩子函数

Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。

InfoQ
开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
产品应用8

Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步

云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。

新智元
产品应用7

Deepseek 正式发布 V3.1:混合推理,Agent能力大幅提高,token消耗减半

Deepseek正式发布Deepseek V3.1,采用混合推理,支持双模式切换,上下文扩展到128k,API支持Claude Code调用。工具与Agent能力提升,思考效率更高,token消耗减半,官方渠道全面升级,9月6号起调整价格。

AI寒武纪
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元
推荐文章7

Anthropic的多智能体,真的有必要吗?

作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。

AGI Hunt
算法论文7

无需人类插手!AI战队自主进化,人类玩家瑟瑟发抖

论文《Agents of Change: Self - Evolving LLM Agents for Strategic Planning》以桌游《卡坦岛》为“考场”测试AI战略能力。研究团队设计四代AI特工,实验显示能自我进化的AI完爆静态AI,不过也存在计算成本高、依赖基础模型等问题。

深度学习自然语言处理
算法论文8

大模型Agent的下一阶段:可自我进化的AI-Agent

在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。

AINLPer
算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。

深度学习自然语言处理
推荐文章7

大模型评估排障指南 | 关于 LaTeX 公式解析

这是大模型评估排障指南系列第二篇,聚焦 LaTeX 公式解析。评估难点是解析和比较模型输出与标准答案,无标准方法。lm - evaluation 框架用 sympy 解析准确率约 0.94,还给出缓解问题办法。

Hugging Face