「智能测试平台」共找到 5759 篇相关文章
哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型
GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。
一个销售数据分析机器人的诞生:看 Dify 如何在 DMS 助力下实现自动化闭环
Dify是低代码AI应用开发平台,但在企业级落地有代码执行和自动化调度瓶颈。本文介绍用“Dify + DMS Notebook + DMS Airflow”架构,以销售数据分析机器人为例,展示构建可调度、可扩展、可运维Agent系统的方法。
世纪反转:“安卓爹”谷歌成 iPhone“大脑供应商”?曝苹果每年掏70亿换定制Gemini,明年上线新Siri
彭博社报道苹果将与谷歌合作,每年付约10亿美元获定制Gemini模型升级Siri,计划明年春季推出。Gemini与苹果自研模型分工,经测试它更符合苹果需求,此合作资金流向反转引网友热议。
首个国产开源AI原生后端,不再写后端,AI就是全栈工程师。
Aipexbase是首个国产开源AI原生后端即服务平台,能在AI辅助下完成前后端一体化开发。开发者无需编写后端代码,通过前端SDK或MCP一键调用后端能力,适配国内生态,定义了AI原生开发新模式。
“神级模型”Gemini 3.0实力刷屏!联手谷歌全新氛围编程工具重塑前端,如今只差官宣
谷歌发布“vibe coding”版AI Studio,产品形态向可视化构建转变。有迹象显示Gemini 3.0将发布,二者结合或重塑前端开发。AI Studio速度快、易用,Gemini 3.0在前端开发测试中表现出色,谷歌借此参与AI竞赛。
社区供稿丨揭秘端到端文档OCR模型 POINTS-Reader
腾讯开源端到端文档OCR模型POINTS-Reader,论文被EMNLP 2025主会录取。它提出可扩展数据生成方案,具简洁、性能好、高吞吐量等特点,通过两阶段训练方案解决依赖蒸馏数据问题,在多基准测试表现佳。
李飞飞一年前究竟说了啥?怎么又火了
AI教母李飞飞一年前访谈再引关注,她指出大语言模型或许并非真正智能,其基于一维语言信号训练,在理解三维物理世界存在局限。相关实验也证实大模型在物理任务表现差,不过也有人提出不同观点。
李志飞:1 个人、2 天做出 AI 时代的「飞书」,真正的 Founder Mode
出门问问创始人李志飞在「TicNote」发布会上分享「一人公司」实验。他用AI编程工具2天做出AI时代“飞书”原型,还谈了使用AI编程问题、对智能和Agent思考等,重新找回AGI信仰。
大模型结构化推理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一
多个机构研究人员联合发布全新多语言法律推理基准数据集LEXam,它含4886道题,每道长篇题有答案和推理路径。研究显示现有大模型应对法律推理难,LEXam引入评估新模式,还对不同模型做了测试。
Skywork AI | 发布Super Agent,一站式搞定写作、开发、分析与创意内容生成
去年谷歌定义了Agent,如今随着大模型发展其能力升级。Skywork AI推出Super Agent平台,有5个专家AI agent和1个通用AI agent,能生成多类型内容且支持溯源。它突破行业瓶颈,还开源相关框架和MCP。