功能测试」共找到 3149 篇相关文章

产品应用7

3亿用户的豆包,能做成办公生意吗?|甲子光年

6月24日,豆包专业版上线,三档定价68元到500元,搭配新模型等功能。它从C端聊天产品转向办公工具,但面临用户心智难改、价格较高等问题,其推出也将影响行业格局,加速C端AI产品免费时代终结。

甲子光年
产品应用7

体验完微信Agent以后,我觉得这就是微信有史以来最大的更新。

作者获微信小微内测资格,深度体验后认为这是微信最大更新。微信Agent打通原生能力有超预期之处,但智能程度不足。功能上有亮点也有限制,如通讯录操作谨慎、小程序适配佳,还能生成小工具。

数字生命卡兹克
产品应用7

Canva可画联合创始人独家专访:2.65亿用户的Canva,用自研模型,解决了设计的审美问题

Canva月活2.65亿,在a16z排名第三。4月16日开启Canva AI 2.0内测。联合创始人Cameron Adams称,自研模型结合14年数据是护城河,Magic Layers功能验证其价值。Canva要成用户进入AI入口,还会在中国持续投入。

Founder Park
开源动态7

“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!

近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。

InfoQ
产品应用7

Cursor自研新模型反超Opus 4.6,价格还“打一折”!网友实测:只有它写完应用能一次跑通

Cursor发布第二代编程大模型Composer 2.0,在关键编程基准测试上反超Claude旗舰模型Opus 4.6,价格还“打一折”。网友实测其写完应用能一次跑通,效率和成本优势明显。但Cursor面临代码编辑器地位下降的危机,正积极自救。

AI前线
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。

机器之心
产品应用8

Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0

作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包大模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强大的自主纠错和多任务处理能力,也指出了不足。

花叔
产品应用8

终于在国产AI上看到了Opus的影子|GLM-5深度实测

作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。

AI产品黄叔
开源动态8

昆仑万维开源的SkyReels-V3,把马斯克请来带货了

1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。

机器之心
算法论文8

斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理