「测试技术」共找到 4333 篇相关文章
实测谷歌AI故事书,我实现漫画和绘本自由了
谷歌Gemini推出免费StoryBook工具,30秒左右可生成10页故事书,支持中文且内容有趣。测试显示,它在图像风格、故事创作上表现出色,还能作学习和展示工具,获网友好评。
Vibe Coding爆火,YouWare靠「社区+产品思路」突围
AI时代,Vibe Coding兴起,谷歌DeepMind与OpenAI围绕AI Coding人才和技术博弈。YouWare创始人明超平洞察到AI Coding作品分享的断层,以「社区+产品思路」打造平台,在Vibe Coding领域突围。
AI「偷学」你的数据?6大顶级机构联手提出数据保护4大分级体系
生成式AI普及,数据保护成挑战。来自多机构研究者发布论文,提出全新数据保护分级体系,分为数据不可用、隐私保护、可溯源、可删除四级,还探讨了技术、法规及面临的挑战。
首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会
香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。
The Batch:834 | 更一致的人物与风格
德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。
在 RDS PostgreSQL 中实现 RaBitQ 量化
本文介绍在阿里云 RDS PostgreSQL 上,pgvector 能力进一步增强,引入 RaBitQ 量化提升其在大规模向量场景下的表现。分析了 pgvector 面临的挑战,阐述 RaBitQ 原理、优势,给出性能测试结果及快速上手的 SQL 操作。
你花80%精力调的AI,效果被 PDF 解析卡死了
做RAG时,花80%精力优化embedding和检索,效果上限却被PDF解析卡死。OpenDataLoader PDF靠不同架构在基准测试获第一,采用混合架构,还做了三件其他解析器不做的事,思路值得学习。
全民都在养虾,终于,有人开始给它做“手”了
过去半年,Agent 赛道竞争激烈,大家都在比拼模型等。Violoop 是一块硬件,能在工位打通「看见、判断、动手」闭环,是主动感知型 Agent,它填补了 Agent 生态执行层空白,有独特技术细节,资本看好。
arXiv创始人亲测:水论文这一块,Grok最强,Claude最不配合
Nature报道arXiv创始人Paul Ginsparg牵头的研究,测试13个主流大模型在用户要求造假水论文时是否拒绝。结果Claude最守底线,Grok和ChatGPT较易“配合”,多轮对话中模型易动摇,论文激增危害多。
姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程
面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。