「AI团队重组」共找到 11623 篇相关文章
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
苹果新论文发出惊人一问:What do your logits know?
苹果AI研究团队提交论文《你的logits知道些什么?(答案可能会让你惊讶!)》,触及大模型底层逻辑及苹果看重的用户隐私与数据安全。研究通过实验揭示模型信息留存状态,指出存在隐私泄露隐患。
DeepEval:LLM 应用评测不再玄学,让大模型评测像写单元测试一样简单
在大模型应用开发中,科学、自动化评测 LLM 输出质量是难题,人工评测效率低。DeepEval 是 Confident AI 团队开源的 LLM 评测框架,能用极简代码让评测像写 pytest 一样自然,内置多种评测指标,支持批量评测等。
Token纪元:从「马力」到「人天」再到「兆字元时」的认知革命
文章指出,AI时代需全新生产力计量单位“马斯”。字元是AI“语言燃料”,但缺乏统一计量体系。智能社会的容量、速度、价格是关键指标,当前AI算力网络停在2G时代,AI劳动力崛起将重构就业,Token或引发文明跃迁。
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
OpenAI明年上市,万亿美元估值将成史上最大IPO
OpenAI正筹备史诗级IPO,估值或达1万亿美元。其通过架构重组削弱微软控制、强化自身独立性,为上市铺路。若成功,将改写AI产业格局,也考验其平衡商业利益与使命的能力。
视频「缺陷」变安全优势:蚂蚁数科新突破,主动式视频验证系统RollingEvidence
蚂蚁数科AIoT团队论文提出主动式可信视频取证系统RollingEvidence,利用相机卷帘门效应嵌入物理水印,结合AI与概率模型验证,抵御伪造篡改,在检测准确率和防护能力上优于传统技术。
红杉、顺为、米哈游等数亿融资,前大疆员工做了款消费级纺织机,目前营收近亿
消费级智能纺织公司浪爪智能获红杉、顺为、米哈游等数亿融资,创始人胡文鑫出身工程师。团队专注消费级纺织 DIY,推出消费级纺织 Station 平台,还在研发纺织 AI Agent,此前产品已获近亿营收。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景
伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。