测试全流程」共找到 3880 篇相关文章

算法论文8

仅需10%思维链标注,等同量性能!中科院发布推理监督新范式

中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达量人工标注性能,适合规则清晰领域,为推理监督提供新思路。

新智元
开源动态8

浙大联合北大开源 Easel:一个 Agent 包办社媒链路,从热点发现到多平台发布!

浙江大学和北京大学联合开源Easel,这是面向社媒创作者的内容工作台,用一个Agent打通链路,有画像驱动等六大亮点,还给出清晰的快速上手流程

开源星探
开源动态7

养虾「不可能三角」:好用、好玩、安,复旦这个「00后」团队做到了!

2026 开年,OpenClaw 带来的 Agent 热度扩散,但安问题凸显。复旦大学马兴军老师团队开源 XSafeClaw,将安监控等前移到可视化界面,实现 Agent 生命周期监控,还注重界面设计,让技术更易被接受。

机器之心
新闻资讯8

设计流程已死:Anthropic 设计负责人 Jenny Wen 谈 AI 时代的设计变革

Anthropic的Claude设计负责人Jenny Wen在Lenny's Podcast中谈AI时代设计变革。她指出传统设计流程被工程速度倒逼走向尽头,还分享在AI实验室做设计的感受、Co - work开发故事等,给出招聘设计师的标准。

宝玉AI
新闻资讯8

拥有Github 的微软终于出手,发布一键生成栈应用的GitHub Spark!

微软发布GitHub Spark,能以自然语言生成栈应用并一键部署,默认用Claude Sonnet 4。它遵循微应用理念,有强大功能体系,深度集成GitHub。开发者看法不一,目前向Copilot Pro+用户开放,或改变市场格局。

AGI Hunt
新闻资讯8

刚刚,马斯克发布Grok-4,在各大基准测试上表现太猛了。

马斯克的 xAI 发布 Grok - 4,在各大基准测试表现出色,如 AIME25 拿满分、GPQA 领先等。第三方测评显示其登顶,编码和数学指数居首。价格与 Grok 3 相同,今日上线但价格高,甚至有已售罄情况。

AI进修生
产品应用8

生成率从8%到60%:快手智能测试用例生成系统的四阶进化

快手研发效能团队构建智能用例生成系统,实现从手动编写到审核校验的模式转变。该系统历经四阶架构演进,将用例生成率从 8% 提升至 60% 以上,成为公司测试人员日常使用的标准化生产力工具。

InfoQ
产品应用7

GLM4.5实测:审美不如R1,栈还不大可用,别急冲

7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。

AI产品黄叔
新闻资讯8

硅谷这一夜,属于中国机器人!图灵奖得主、英伟达大牛来了

美西4月28日,具身智能球性峰会GEIS在硅谷落幕。中国公司魔法原子发起,图灵奖得主演讲,英伟达等科学家对谈。会上发布世界模型Magic - Mix、灵巧手H01和人形机器人MagicBot X1三款产品,展现栈自研实力。

新智元
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜面登顶,实现文本、视觉、Web开发方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt