「员工绩效评估」共找到 1078 篇相关文章
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
国产Agent第一股要来了?但官网都打不开,什么妖魔鬼怪?
国内最大AI数字员工公司冲刺IPO,要做企业Agent第一股,但其官网无法访问。该企业级Agent平台是RPA+AI组合,RPA有致命问题,大模型加入后虽有变化,但事情本身护城河不深,公司靠定制化冲击IPO,且仍亏损。
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
GPT-5两周内发布,内测猛料流出?GPT-6或已开始训练,奥特曼剧透百万GPU
有爆料称GPT-5将在两周内发布,是多模型组成的系统,含「路由器」,GPT-6已在训练。奥特曼称年底将增超百万GPU,有人看好GPT-5,也有人认为它可能只是路由器。此外,OpenAI有十名员工拒小扎3亿天价offer。
给AI打个分,结果搞出17亿估值独角兽???
大模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。
有生之年吃到了钉钉的细糠
作者参加“2025 钉钉十周年暨新品发布会”,体验了钉钉 8.0 版本。该版本开启 AI 1.0 新篇章,界面焕然一新,以钉钉 One、AI 搜问等重塑工作流程,还升级语音智能硬件,实现信息处理闭环,提升企业与员工效率。
拒绝小扎15亿美元offer的大佬,还是加入Meta了
曾拒绝小扎15亿美元薪酬包的机器学习大神Andrew Tulloch加入Meta。他此前在Meta工作11年,后到OpenAI,今年1月随前CTO创立公司,两个月前还拒绝Meta邀约,现入职具体工作未知。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
Docker 通过 Cagent 提供 AI 代理确定性测试
AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。
良心老黄不搞硅谷资本家那套!Groq人均套现500万美元
英伟达200亿美元收购「TPU之父」创业公司Groq,老黄给股东分红,90%团队被打包带走,人均到手500万美元。收购规避反垄断审查,还解锁新方案LPU,有望打造全栈方案。