「自主智能测试」共找到 5136 篇相关文章
心得分享:凭借 Cursor,数周内完成产品上线月收入过万!
网友用Cursor数周开发垃圾邮件清理工具获利,月收入近1500美元。他分享七条使用心得,如提示“自顶向下”、测试先行等,还建议关注交付效率和质量,持续迭代。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
首次,AI下棋不再是「黑盒」!
上海AI Lab发布升级版大模型「书生·思客InternThinker」,首度打破围棋AI推理黑盒,能用自然语言解释落子逻辑,具备职业3 - 5段棋力。依托创新训练平台InternBootcamp,它在多任务表现出色,且相关技术有系列创新突破。
最新!OpenAI:GPT-5将实现大统一,Codex最佳实践是这样的
OpenAI Codex在Reddit AMA活动中,核心负责人围绕先推云端代理、GPT - 5与Operator整合等问题给出路线图。如Codex - 1预览情况、CLI设计、使用场景、安全模型、接入计费及API生态等方面都有说明。
PDF文件长出「AI大脑」?网友惊呼:这操作太「黑科技」了!
极客Aiden Bai将大语言模型塞进PDF,可让AI讲故事、聊天,Linux系统也能在其中运行。项目嵌入小型语言模型,如TinyStories、Pythia和TinyLLM,利用PDF支持的JavaScript实现,虽有局限但潜力大。
StarRocks MCP Server 开源发布:为 AI 应用提供强大分析中枢
过去,开发者让大模型用数据库查询数据需开发插件等,费时费力且难复用。StarRocks MCP Server 提供通用接口,让 LLM 标准化访问 StarRocks,执行 SQL 查询。MCP 规范模型与上下文交互,其核心组件分工明确。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
Aether AI发布首个因果世界模型,世界模型开始思考“行动背后的因果”|甲子光年
本文报道Aether AI发布全球首个因果世界模型CausalWM,该模型在TriWorldBench评测榜单以66.04分登顶榜首,采用创新因果思维链机制,探索降低AI机器人落地"重训税"的新路径。
从Chat、Code到Discovery,AI开始学着做科学家
本文报道AI发展进入全新阶段,任务从聊天、写代码拓展到自主科学发现,介绍PhAI Labs推出的DFM系统,分享架构设计与落地案例,分析行业痛点与解决路径。