「技术评估」共找到 3421 篇相关文章
独家丨天机智能完成10亿元B轮及B+轮融资,估值近百亿,高瓴、美团联合领投
AI科技评论独家获悉,具身智能基础设施公司「天机智能」完成10亿B轮及B+轮融资,投后估值近百亿。其深耕底层技术,多项技术突破,产品优势明显。融资将投向三方向,还布局整机产品。
一场文心大模型的「AI马拉松」
2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。
史上首次!米兰冬奥基于阿里千问打造奥运官方大模型
2月5日,国际奥委会主席柯丝蒂·考文垂宣布基于阿里千问打造奥运史上首个官方大模型,已在赛务与公众服务双端落地。此外,自动媒体描述系统、AIGC技术等也有应用,阿里云多项技术助力米兰冬奥。
内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!
OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能体系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
困在产业落地的数据流通,开源会成为“破局点”吗?
AI时代数据成生产要素,但可信流通困于产业落地。8月14日隐语开源社区三周年升级,扩容为‘隐语·数据可信流通技术社区’,覆盖多技术路线。其以开源降低应用门槛,或改写数据产业规则。
Notion Custom Agents复盘:三年重写5次,Notion 历史上最成功的新功能之一
Notion 的 AI 工程负责人 Sarah Sachs 和技术负责人 Simon Last 在采访中分享 Agent 探索思考。Custom Agents 是 Notion 历史上转化率高的新功能,开发三年重写 5 次。他们还谈及产品路线、模型评估、技术方向等内容。
从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理
复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理。
ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则
这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。
LLM应用测试范式的进化
文章指出传统软件测试方法在LLM应用中存局限,探讨将其与AI评估结合应对挑战。抽象出LLM应用三层架构模型,分析传统测试范式适用性,介绍AI安全分析方法,阐述测试挑战、范式转变及协同测试策略。