「形式化验证系统」共找到 2427 篇相关文章
AI Agent 的工程化被低估了
文章指出 AI 发展中工程化作用被低估,将其分为产品工程和技术工程拆解构建 AI Agent 体系。产品工程涵盖需求建模、UI/UX 设计等模块;技术工程涉及架构模块化、流量控制等方面,还提及 Spring AI Alibaba 等工具。
AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%
大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。
刚刚,Scale AI CEO Alexandr Wang正式官宣:Meta重金投资并挖走了我
Meta重金投资Scale AI,收购其49%股权。97后Scale AI CEO Alexandr Wang将离开,加入Meta参与AI工作,Scale由Jason Droege任临时CEO。Wang称数据是AI系统生命线,此为公司及个人发展契机。
昨夜,全球AI 集体宕机!
昨夜全球互联网大崩溃,谷歌云服务故障致13项服务崩溃,AI服务全军覆没,OpenAI也受影响,三大云巨头同时宕机,连锁反应使多平台瘫痪。事件暴露互联网脆弱性,给人们敲响警钟。
最大的开源GraphRag:知识图谱完全自主构建|港科大&华为
香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模式。该系统利用大模型提取知识三元组并归纳模式,构建了ATLAS系列知识图谱,经测试表现优异。
精准调控大模型生成与推理!浙大&腾讯新方法尝试为其注入“行为定向剂”
ACL 2025中选论文里,浙大与腾讯联合团队提出STA方法,深入模型内部分析神经元激活模式,干预关键神经元,抑制有害行为、保留通用性能,还在多模型实验验证效果,并将部分方法开源。
从性能到实战,怎样才算是靠谱的 Agent 产品?
红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。
Anthropic CEO:人的幻觉比AI 更多!这是真的吗?
Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。
AI发现新物质,仅用200小时!不写一行代码,筛选36.7万种物质
微软在Build大会推出企业级AI科研平台Microsoft Discovery,结合专业AI Agent与高性能计算。它能让无编程背景人员用自然语言使用超算与模拟系统,200小时筛选36.7万种物质找新冷却剂。
清华刘知远团队:高质量LLM训练数据获取新方法!成本降90%,性能大提升
清华刘知远团队论文提出全新数据筛选方案,解决传统数据筛选验证慢、主观性强问题。发明‘半成品加工法’降成本,用fastText筛数据,筛出Ultra - FineWeb数据集,提升模型性能,还计划拓展到专业领域。