查看“︁Harness”︁的源代码
←
Harness
跳转到导航
跳转到搜索
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
{{Infobox Software Concept | 名称 = Harness / AI 马具 | 别名 = 智能体外壳 (Agent Shell)、大模型运行外壳、Agent Harness | 提出背景 = [[大语言模型]](LLM)向交互式[[智能体]](AI Agent)演进 | 核心职能 = 工具解耦、环境隔离、执行跟踪、沙箱安全 | 代表实现 = DeepSeek Harness、Claude Code、LangChain LangGraph }} '''Harness'''(在人工智能领域常被称为'''AI 马具'''、'''智能体外壳'''或'''运行外壳''')是一种通用的 AI 软件架构概念。其核心作用是将纯粹进行逻辑推理的“大语言模型(LLM)大脑”,与能实际操作计算机系统的“身体部件(如[[文件系统]]、[[命令行]]、[[网络检索]]、网页浏览器)”进行彻底解耦与连接。 “Harness”一词原本指马车上的马具。在 AI 时代,该术语被借用来指代“套在大模型身上的约束、控制和赋能框架”——它既为大模型提供操控外界的接口(赋能),又严格限制其越权行为并记录其一举一动(约束)。 == 核心设计公式 == 在当前 AI 行业,普遍存在一个技术公式: :<math>\text{Agent (智能体)} = \text{Model (模型大脑)} + \text{Harness (通用外壳)}</math> * '''Model(模型)''':仅负责接收文本/视觉输入,并预测输出下一个 Token(思考、判断、生成代码)。 * '''Harness(马具)''':负责解析模型输出的代码或工具调用(Tool Call),在真实的、隔离的沙箱环境中执行该操作,并将执行结果(如报错信息、网页内容、终端输出)重新塞回模型的上下文中。 == 通用 Harness 的核心职能 == === 1. 一切皆插件(解耦架构) === 先进的 Harness 架构通常采用高度模块化的插件系统(如基于 [[Cordis]] 内核)。它确保没有任何工具拥有特权,包括以下组件均可热插拔: * '''模型适配器(LLM Adapter)''':同一套外壳,既可以接入本地的 DeepSeek 模型,也可以一键切换至云端的 GPT-4、Claude 或 Gemini。 * '''执行工具(Tools)''':如文件读写器、Bash 终端、浏览器自动化工具(Playwright)。 * '''交互界面(UI/UX)''':可以自由切换为命令行(TUI)、Web 网页或跨平台桌面客户端。 === 2. 事件溯源与运行轨迹可观测性 === 通用 Harness 必须严格遵循“'''模型可见 ⟺ 已记录'''”(Model-Visible ⟺ Logged)的不变量原则。AI 在执行复杂任务(如自主修 Bug)时,中间经历的所有思考、命令调用、失败重试、报错日志,都会被 Harness 以“仅追加(Append-only)”的方式记录为一条完整的'''轨迹(Trajectory)'''。 * '''回放与搜索''':人类用户可以像看录像带一样回放 AI 的行为。 * '''分叉与恢复(Forking)''':用户可以随时把 AI 的某一步骤“分叉”出去进行实验,测试不同的引导词,且不破坏原有的主线会话。 === 3. 安全护栏与沙箱接缝 === 由于 Harness 赋予了 AI 操作系统级别的极高权限,安全防护是其必不可少的核心: * '''权限隔离(Sandbox Seam)''':Harness 底层通常封装了沙箱技术(如 `bwrap` / Bubblewrap、`Landlock`、Docker 等),将 AI 的读写范围限制在特定的项目工作区内,防止大模型误删系统盘。 * '''人类介入(HITL / Human-in-the-Loop)''':对于高危操作(如删除文件、执行 `rm -rf`、发送网络请求或产生经济扣费),Harness 会自动触发人类审批机制(`ctx.approval`),暂停 AI 运行并等待人类一键确认。 == 行业主流实现方案对比 == {| class="wikitable" ! Harness 实现名称 !! 发起方/生态 !! 核心特点 !! 主要适用场景 |- | '''[[Deepseek harness|DeepSeek Harness]] (dsh)''' || [[深度求索]] 开源 || 极致的声明式配置(YML 驱动)、完全解耦、高并发、基于 TypeScript。 || 开源社区全自主、全模态 Agent 构建。 |- | '''Claude Code''' || Anthropic || 与 Claude 3.5/3.7 紧密集成,主打极致的终端自动化编码、上下文高精度控制。 || 终端命令行、程序员日常编程辅助。 |- | '''LangGraph / AutoGen''' || 传统 Agent 框架生态 || 侧重于利用多 Agent 编排、有向无环图(DAG)来规定复杂的业务流。 || 企业级多智能体协同、固定工作流自动化。 |} == 局限性与行业挑战 == * '''Token 膨胀与成本控制''':Harness 为了让大模型获得完美的情境感知,需要不断把工具执行结果重发给模型,易导致 Token 消耗呈指数级上升(尤其是在多轮迭代和重试中)。 * '''幻觉级安全越狱''':当大模型产生严重的“幻觉”或遭受外部提示词注入攻击(Prompt Injection)时,Harness 的安全护栏是否能 100% 拦截恶意的系统指令,仍是目前学术界与工业界的攻防焦点。 == 参见 == * [[智能体]] (AI Agent) * [[大语言模型]] (LLM) * [[沙箱]] (Sandbox) * [[DeepSeek Harness]] [[分类:人工智能]] [[分类:软件架构]] [[分类:开发框架]]
该页面嵌入的页面:
Template:Infobox Software Concept
(
查看源代码
)
返回
Harness
。
导航菜单
个人工具
中文
登录
命名空间
页面
讨论
不转换
不转换
简体
繁體
大陆简体
香港繁體
澳門繁體
大马简体
新加坡简体
臺灣正體
查看
阅读
查看源代码
查看历史
更多
搜索
导航
首页
最近更改
随机页面
MediaWiki帮助
特殊页面
工具
链入页面
相关更改
页面信息