「测试平台」共找到 2960 篇相关文章
这个春节P图不求人!小红书开源图像编辑新SOTA
今日小红书基础模型FireRed - Image - Edit亮相,在复杂编辑指令、风格化转换等核心指标表现强,在多项权威测试达SOTA。该项目代码等已开源,模型权重将开源。团队还推出RedEdit Bench评测方案。
数字技术工人已到岗!时序大模型+Agent已掌握了工厂生产管控技术,比人类更懂工况
基于时序大模型和Agent的数字技术工人,能承担生产操作等关键任务,接手复杂工业环节。国内AI团队打造的河谷平台构建智能体,自研底层技术,以工艺维度训练,上岗快,极峰科技还创新商业模式。
阿里WebDancer:训练类DeepReaserch的Agentic Model
来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。
突发:Claude引入强实名制验证!必须真人手持证件自拍,否则直接封号!
Anthropic宣布在Claude平台推出身份验证功能,部分用户访问特定功能或触发风控时需强制验证,要手持证件自拍。这一举措让中国用户账号风险大增,还可能冲击相关生态链,用户或转向ChatGPT。
Meta归来!时隔一年发布Muse Spark,重回第一梯队
Meta发布Muse Spark模型,这是MSL团队首款模型。此前Llama 4表现不佳,刺激Meta重组。Muse Spark性能超Llama 4,计算效率提升,在测试中成绩优异,Meta AI战略转向闭源探索,模型已上线。
藏师傅开发的 Codepilot 保姆级入门攻略
本文是藏师傅开发的 Codepilot 全平台通用开源 Agent 客户端的保姆级入门攻略,介绍了其特色功能,涵盖安装、配置服务商、聊天、技能使用等方面,助读者快速上手。
The Batch: 899 | 更划算的推理
研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。
李飞飞站队LeCun,AGI全是炒作!80分钟重磅爆料出炉
李飞飞在Lenny Rachitsky播客中回顾AI发展,揭秘秘辛。她认为AGI是营销用语,世界模型才是未来十年AI前沿。还谈到ImageNet诞生、机器人困境等,其创业公司World Labs的Marble平台应用广泛。
性价比搏击:Grok 4 Fast 推理成本直降 98%
xAI上周五发布旗舰模型轻量化版Grok 4 Fast,推理成本直降98%。它通过强化学习在基准测试表现佳,有原生工具调用能力,采用统一架构,性价比高,或改写大模型竞争规则。
250 个岗位换两亿“求生”资金?巅峰781 亿市值巨头节流押注 AI,CEO急踩 “创业模式” 刹车
自由职业服务平台 Fiverr 宣布裁员 250 人,约占员工总数 30%,是为转型“AI 优先”企业的重组举措。创始人兼 CEO 称能省两亿,还可提升员工生产力。此前他就预警 AI 会影响工作。