Claude 3.7 Sonnet」共找到 3621 篇相关文章

产品应用7

Anthropic更新了Skill Creator,评测框架上线

Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。

AI工程化
产品应用2

cursor 2.0实测:cursor的摆烂之作

作者实测Cursor 2.0后大失所望。它交互粗糙,多智能体虽有多个回答但选方案操作不明;因Claude涨价推出智能分发和自研Composer,后者除快无优势且需魔法;内置浏览器交互麻烦,窗口管理离谱,语音模式基本不可用。

AI产品自由
新闻资讯8

MagicOS已成世界「第三极」,荣耀拿下AI大战叙事权

全球智能手机进入AI决战期,苹果、谷歌、三星等厂商各有局限。荣耀推出MagicOS 10及YOYO智能体,其具备自进化能力,背后有魔法大模型3.0矩阵支撑。荣耀在技术、生态、市场等方面全链路突破,有望执掌全球AI终端话语权。

新智元
新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
算法论文8

击败Meta登榜首:推理增强的文档排序模型ReasonRank来了

本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。

机器之心
产品应用8

拆解 WorkBuddy、千问办公和豆包工作,它们其实不是同一种产品

本文作者用真实职场脏活测试腾讯WorkBuddy、阿里千问办公、字节豆包工作三款办公Agent,对比三者产品路线、执行结果和执行环境差异,揭示当前办公Agent的发展现状与局限。

AI科技评论
新闻资讯8

“公司终局是纯 AI、纯机器人!”马斯克酒后激进预言:让机器人造机器人,未来要靠AI留着人类智能

近期马斯克参与近3小时对话,探讨太空数据中心、人形机器人等话题。他认为地面电力扩张难,太空是AI部署的经济选择,预计五年后太空AI量超地球。还指出未来公司形态是纯AI和机器人,中国制造业强且工作投入高。

InfoQ
新闻资讯8

Google 悄悄升级了 Deep Think,ARC-AGI-2 直接干到 84.6%

Google DeepMind 升级了 Gemini 3 的专用推理模式 Deep Think,跑分屠榜。ARC - AGI - 2 拿下 84.6%,在多个基准测试中表现优异。它不仅是解题机器,还能解决真实科学工程问题,已向部分用户推送,科研人员和开发者可通过 API 使用。

AGI Hunt
新闻资讯8

一年拿下三轮融资!影目INMO正在鼻梁上“复刻”一个AI手机

影目INMO在一年拿下三轮融资,近5亿资金到位。其产品INMO GO3等表现出色,首发预订量可观。该公司专注轻量化一体式AI+AR眼镜,结合自研系统与智谱大模型,还拓展线下渠道,全球化布局也在推进。

量子位
开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。

新智元