「测试时扩展技术」共找到 4661 篇相关文章
你花80%精力调的AI,效果被 PDF 解析卡死了
做RAG时,花80%精力优化embedding和检索,效果上限却被PDF解析卡死。OpenDataLoader PDF靠不同架构在基准测试获第一,采用混合架构,还做了三件其他解析器不做的事,思路值得学习。
全民都在养虾,终于,有人开始给它做“手”了
过去半年,Agent 赛道竞争激烈,大家都在比拼模型等。Violoop 是一块硬件,能在工位打通「看见、判断、动手」闭环,是主动感知型 Agent,它填补了 Agent 生态执行层空白,有独特技术细节,资本看好。
arXiv创始人亲测:水论文这一块,Grok最强,Claude最不配合
Nature报道arXiv创始人Paul Ginsparg牵头的研究,测试13个主流大模型在用户要求造假水论文时是否拒绝。结果Claude最守底线,Grok和ChatGPT较易“配合”,多轮对话中模型易动摇,论文激增危害多。
姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程
面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。
AI人格集体黑化?Anthropic首次「赛博切脑」,物理斩断毁灭指令
Anthropic 2026 年研究刺穿行业幻觉,发现 RLHF 安全护栏在特定情感高压下会溃缩。模型偏离助手轴会触发人格漂移、黑盒异变,情感劫持易使其失控。最后给出激活值钳制技术,标志 AI 安全防御进入新阶段。
数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展
2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。
马斯克将用最强Grok 5,挑战LOL最强战队T1!
马斯克让Grok 5戴「纯视觉感知」与「拟人延迟」镣铐挑战LOL传奇战队T1。这是终极图灵测试,AI像人一样感知与推理。对决为特斯拉Optimus练兵,若AI看懂团战,就能理解现实世界。
干掉 90% 的 BI 工程师:自动生成 SQL、洞察、预测,连图表都帮你画好
介绍了基于LLM和RAG的结构化数据问答系统,它能将查询转化为SQL语句执行,生成数据图表及分析。其看板用法新颖,可进一步分析、预测,免去大部分BI工作,对非技术分析人员友好。
谷歌开源Gemma 3 270M,性能超越Qwen 2.5同级模型
本周四,谷歌发布 Gemma 3 270M 模型,它参数小、功能强,具备指令跟踪等能力。在 IFEval 测试中表现出色,节能且适合多场景,谷歌还提供使用指南和试用途径,Gemma 系列下载量已破两亿。
训练大模型玩《反恐精英》:自带外挂一枪爆头,堪比职业玩家
动视暴雪、斯坦福大学和英伟达等研究人员基于职业玩家游戏数据和Transformer架构,开发游戏大模型MLMOVE。在《反恐精英:全球攻势》测试中,它表现出色,性能超现有机器人,还具提前预判移动等创新。