「产品评估」共找到 2246 篇相关文章
奶牛版 Oura 估值 10 亿美金,AI+PDF 让它拿了 1700 万美金融资
市场上多数AI PDF产品是ChatPDF模式,用于C端。企业关键非结构化数据多在PDF等传统载体中,难以获取。硅谷工程师做的Extend AI产品,获1700万美金融资,解决传统文档处理难题,打造平台。
对话关梦龙:他想用 Agent 拯救你手机里的 100G 废片
前字节跳动剪映早期成员关梦龙,正开发AI编导产品“Cutto”,让AI参与内容生成,降低普通人创作门槛。他认为AI虽提升生产力,但创业竞争更激烈,产品成功需看用户能否持续使用。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
爆火的 AI 玩具赛道,全行业都在等一个「成功者」
过去一年,AI玩具创业火热,众多大厂背景创业者入局。但现状尴尬,鲜少有能售卖产品,已推出的产品反馈不佳。目前AI玩具实质多为毛绒玩具加语音盒子,创业者面临技术和成本等难题。
离开OpenAI后,这位27岁的首席AI科学家要带腾讯走向AI的下半场|姚顺雨
今年9月姚顺雨从OpenAI离职传闻加入腾讯,如今腾讯内部公告尘埃落定。27岁的他出任腾讯相关要职,腾讯还升级架构。他学术成果丰硕,有产品能力,提出AI下半场观点,或为腾讯带来多方面提升。
一人公司创业,如何找对方法论、选准装备库?
AI让一人做产品更易,全国一人有限责任公司数量增长,相关服务生态成形。时踪由阿泰独立研发,从个人痛点出发做出产品,其95%云服务选阿里云。阿里云为OPC创业者提供阶段化“装备库”。
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则
这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。
LLM应用测试范式的进化
文章指出传统软件测试方法在LLM应用中存局限,探讨将其与AI评估结合应对挑战。抽象出LLM应用三层架构模型,分析传统测试范式适用性,介绍AI安全分析方法,阐述测试挑战、范式转变及协同测试策略。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。