AWS Hong Kong Summit 2026 · Developer Lounge 精华回顾

Agent Harness 才是真正的工程护城河

AWS Hong Kong Summit 2026 · Developer Lounge 精华回顾 · 第 2 / 6 篇

AWS Magazine · 维多利亚港现场报道


高科技遇上海港奢华:Developer Lounge 现场气氛

踏进 AWS Hong Kong Summit 2026 Developer Lounge,能量几乎可触。落地玻璃框住维多利亚港全景,游艇在正午阳光反射的水面滑过。室内把香港招牌奢华感与超现代云创新无缝接在一起。从旧金山、东京、伦敦、西雅图飞来的工程师、创始人与科技领袖,陷进天鹅绒沙发,一边喝手工 espresso,一边凑近发光屏幕。

这里不只是拿贴纸或看预录 demo 的地方,而是商业协作与激烈技术交流的震中。主舞台周围的玻璃 VIP 包厢里,风投与创业公司创始人进行私人聚会。对话充满高风险财务动态——一边谈种子轮(money in),一边谈生产基础设施烧钱速度(money out)。白板墙上,staff architect 与独立 builder 画出复杂系统拓扑,讨论如何把原始模型智慧转成企业级软件。

+-----------------------------------------------------------------------------------+
AWS HONG KONG SUMMIT 2026 DEVELOPER LOUNGE

[ 海港景观 VIP 角落 ]              [ 白板架构区 ]
  - 私人聚会与提案                   - 模型花费 vs harness 护城河
  - Money in / money out             - 即时代码与架构对谈

[ 动手 Lab 与 Espresso Bar ]       [ 主舞台与闪电讲 ]
  - Managed memory 与 CLI 配置       - Trista Pan agent harness 主题演讲
  - 动手体验 AWS AgentCore GA        - 国际讲者面板
+-----------------------------------------------------------------------------------+

开场:Lounge 从 Demo 转向正式上线

若说 2025 年香港 AWS AI 场景像整晚烟火——到处是亮眼 agent 原型、每周 demo、社区帖文秀模型能力——那么 AWS Summit Hong Kong 2026 标志运营成熟度的到来。Lounge 里回荡的核心问题不再是「看模型能做什么」,而是关键的生产问题:你要如何安全地把 agent 送进正式环境?

在 Developer Lounge,这个问题的焦点落在 Trista Pan 那场站无虚席的闪电讲。工程师与顾问伙伴挤在白板前辩论一个中心前提:模型花费是 money out;harness engineering 是会复利的钱。

原始长文(builder.aws.com): Agent Harness: Where Engineers Add Value When Models Keep Getting Smarter

演讲同期,AWS 宣布 Amazon Bedrock AgentCore Harness 正式上市(GA)——提供模型自己吸收不了的生产运营层。

GA 公告: Amazon Bedrock AgentCore harness is now generally available


随着 AI 模型成熟,工程杠杆正从裸模型转向 agent harness——围绕模型、把价值导向用户与 builder 的脚手架。2025 年产业用快速原型证明 agent 能力;2026 年焦点成熟为运营管控与可靠性。分析师 Aakash Gupta 一句话总结:「2025 was agents;2026 is agent harnesses。」真正价值,来自让 agent 在正式环境可靠运作。


气氛转变:从「做不出来吗?」到「跑得起来吗?」

模型越来越强时,工程杠杆正移向周围脚手架——价值要么 向外服务客户,要么 向内服务 builder

  • 去年,agent 在各产业全面爆发,每周都有新 demo。

  • 2025 年主流问题是「我们能不能做一个会做 X 的 agent?」,答案几乎都是可以。

  • 今年问题成熟了:快速起一个简单 agent 很容易,但要把周末原型变成正式系统,需要 可靠性与运营管控

正如 Aakash Gupta 所说:「2025 was agents;2026 is agent harnesses。」


公式:Agent = Model + Harness

延续 Vivek Trivedy 在 The Anatomy of an Agent Harness 的框架,现代 AI 应用的核心架构身份可用一句简单公式表达:

Agent = Model + Harness

若某个元件不是核心基础模型本身,它就属于 harness。工具、记忆、prompt engineering、编排、可观测性、护栏、路由、部署,全属 harness engineering。系统性地设计这套 harness,并把运营失败转成永久系统修正——Mitchell Hashimoto 常强调的方法——正是 harness engineering 这门学科。

Lounge 里最容易听懂的汽车比喻

为了让新手直觉理解,现场讲者用经典汽车比喻:

  • 模型是引擎:产生动力、推理、规划与原始驱力。

  • 但你不能把地板上的裸引擎交给驾驶。

  • 可上路车辆还需要底盘、方向盘、刹车、仪表、安全带与大灯。

  • 引擎产生动力,harness 才把动力转成日常可用、安全可靠的车。

高性能模型不保证成功的正式 agent,正如强劲引擎不保证安全汽车。

奢华餐饮比喻

香港顶级餐厅从不只靠高级炉火;成功仰赖订位管理、厨房协调、品控与接待。AI 架构亦然:模型是火焰,harness 是整套运营管理。


Harness 有两半

Agent harness 的职责平均分在构建期能力与运行时运营:

半边 主要功能 工程心态
Development(开发) 延伸模型能力:跨会话持久记忆、Model Context Protocol(MCP)工具整合、检索增强上下文、系统 prompt 架构、规划与任务编排。 Builder 工艺与架构
Operations(运营) 确保企业可靠性:端到端可观测性、评估回路、护栏强制、模型路由、成本/漂移监控、部署管线与自动扩缩。 经典云运营

Martin Fowler 团队正式把这门技术学科称为 harness engineering。把应用能力分类时,只有一小部分属于模型本身,绝大多数属于 harness 层。


真实证据:同一模型,更好的 Harness

面对「等更强模型就好」的质疑,讲者分享实证:在 模型不变 的前提下,只优化 harness 基础设施。

1. Vercel v0 — 更少上下文,更高效率

大 context window 需要主动管理,否则过期信息会拖垮表现。Vercel v0 团队把主动工具集从 15 个砍到 2 个核心 primitive(bash 与文件系统)。

  • 准确率:80% 升到 100%

  • Token 花费: 下降约 37%

  • 延迟: 响应快约 3.5 倍

2. LangChain on Terminal Bench 2.0

加上明确 harness 元件——自我验证回路、完成前检查清单、循环检测——在相同模型后端上:

  • 基准分数:52.8% 跳到 66.5%

  • 排名: 约从前 30 进入前 5。

3. 更小模型打败旗舰模型

  • Hebia: 把 GPT-5.4 mini 放进金融与法律专用 harness,通过率与来源归因胜过未加 harness 的旗舰模型,token 成本更低。

  • MIT CSAIL Recursive Language Models: 把 GPT-5-mini 包进可对上下文片段递归调用自身的架构(无需 fine-tune),基准 64.9% vs 30.3%,对上明显更大的模型配置。


模型会不会把 Harness 吞掉?

开发者常见担心:基础模型快速进步,会不会让 harness engineering 变多余?

模型正在吸收什么

某些低阶工作越来越常由新模型原生处理:

  • 上下文处理: 扩大 context window 降低手动切块负担。

  • 规划: 进阶推理模型可维持长程连贯,不必复杂手动 sprint 拆解;Addy Osmani 指出这大幅减少 context-anxiety 失败模式。

  • 基本自我修正: 拒绝模式与基本输出验证越来越内建于裸模型。

为什么运营层仍然不可或缺

Harness 会往软件堆栈更高层移动。核心运营责任——模型路由、基础设施扩缩、成本追踪、安全强制、遥测——仍与裸模型智慧不同。

关键收获: 模型没办法当自己的多供应商路由器、基础设施扩缩器,或成本治理引擎。

+-----------------------------------------------------------------------------------+
EVOLUTION OF THE AGENT HARNESS STACK

Operations Layer(成长)
  - 多模型路由与成本优化
  - 护栏强制与可判定权限
  - 分布式追踪与 CloudWatch 可观测性

Model Layer(吸收低阶任务)
  - 扩大 context window 与基本规划
  - 原生函数调用与基本自我修正
+-----------------------------------------------------------------------------------+

元件演化分析

元件 被吸收/淘汰的能力 持续成长的高杠杆责任
Memory 单会话暂存草稿。 多会话持久化、跨 agent 状态共享、知识图谱。
Tools / MCP 复杂工具包装定义。 原子执行 primitive、MCP 生态、动态工具组装。
Planning 短期上下文拆解。 多日执行、长程依赖追踪、适应性规划。
Context 基本 prompt stuffing 与简单 RAG。 渐进式上下文揭露、上下文质量策略、递归上下文处理。
Prompts 单体 prompt 文字块。 阶层规则定义、测试驱动指示文件、rules-as-code。
Observability 简单 console.log。 分布式追踪管线、trace mining、语义执行分析。
Evaluation 临时手动 prompt 评估。 外层评估回路、领域测试套件、自动化 LLM-as-judge。
Guardrails 软性 prompt 约束(「请不要……」)。 可判定 hook、权限闸门、构建管线整合。
Routing 静态单一模型绑定。 跨供应商动态成本/质量路由。
Deployment 单脚本本地执行。 沙箱环境、机群恢复、生命周期管理。

AI 工程团队的策略方向

鼓励开发者与创业公司刻意选择两大策略之一:

  1. 方向 A — 向外服务客户: 专注产品设计、用户体验与领域解题。用托管 harness 搭配前沿模型,小团队也能以更低人力交付复杂应用。

  2. 方向 B — 向内服务 Builder: 打造可重用开发工具、自定义 middleware、评估回路与领域路由基础设施。这会创造跨多代模型仍保值的长期价值。


深潜:Amazon Bedrock AgentCore Harness GA

随着 Amazon Bedrock AgentCore Harness 正式上市,AWS 提供托管基础设施抽象,简化 agent 正式部署。

+-----------------------------------------------------------------------------------+
AMAZON BEDROCK AGENTCORE HARNESS (GA)

API 接口:CreateHarness / InvokeHarness

Harness 底下的原语
  - Runtime       计算
  - Memory        语义状态
  - Gateway       API / MCP 工具
  - Browser       网页沙箱
  - Interpreter   Python / Node 沙箱
  - Identity      凭证保管库

可观测性:CloudWatch 统一 harness 追踪
+-----------------------------------------------------------------------------------+

架构总览与关键能力

延续 Simon Willison 的定义——「LLM agent 在循环中执行工具以达成目标」——AgentCore Harness 简化周围运营负担。本地原型 agent 循环很容易,但正式环境传统上要管沙箱计算、网络隔离、身份保管、会话持久化与分布式追踪。AgentCore Harness 用两个核心 API——CreateHarnessInvokeHarness——取代自建基础设施。

1. 多模型弹性与供应商切换

AgentCore Harness 把 agent 配置与单一模型供应商解耦。开发者可定义默认模型,并在每次调用动态覆盖,或在会话中途切换供应商且保留对话状态。

支持的模型供应商包括:

  • bedrock:访问 Amazon Bedrock 上的模型,含 Anthropic Claude、Amazon Nova、Meta Llama、DeepSeek、Qwen、Kimi、MiniMax、Cohere、Mistral,以及 Bedrock 上的 OpenAI GPT-5.5、GPT-5.4。

  • openAi:直连 OpenAI API(api.openai.com)。

  • gemini:直连 Google Gemini API。

  • liteLlm:通用第三方端点整合,含 Azure OpenAI、Vertex AI、Cohere 与自建端点。

外部模型供应商的 API 密钥由 AgentCore Identity token vault 管理,避免凭证暴露在原始模型上下文。

2. 声明式工具整合

工具在创建 harness 时以 tools 数组结构化声明:

"tools": [
  { "type": "agentcore_browser" },
  { "type": "agentcore_code_interpreter" },
  { 
    "type": "remote_mcp",
    "name": "X_tool",
    "config": { "remoteMcp": { "url": "https://mcp.X_tool/mcp" } } 
  },
  { 
    "type": "agentcore_gateway",
    "name": "Y_tool",
    "config": { "agentCoreGateway": { "arn": "arn:aws:bedrock-agentcore:us-west-2:123456789012:gateway/gw-xyz" } } 
  }
]

每个执行会话都自动具备原生 shellfile_operations,不必手动包工具。可用 InvokeHarnessallowed_tools 在运行时选择性允许或限制工具。

3. 托管会话记忆

CreateHarness 时若省略明确 memory 标志,会自动预配具企业默认值的托管记忆:

  • 策略: 结合 SEMANTIC 索引与 SUMMARIZATION 处理。

  • 数据保留: 默认事件 30 天过期(可配置)。

  • 安全: AWS 托管加密,并以 actorId 做租户隔离。

// Example: Managed Memory Configuration
"memory": {
  "managedMemoryConfiguration": {
    "strategies": ["SEMANTIC", "SUMMARIZATION"],
    "eventExpiryDuration": 30
  }
}

// Example: Bring Your Own Memory ARN
"memory": { 
  "agentCoreMemoryConfiguration": { 
    "arn": "arn:aws:bedrock-agentcore:us-west-2:123456789012:memory/mem-abc" 
  } 
}

// Example: Stateless Execution
"memory": { "disabled": {} }

4. 模块化 Skill 整合

Skills 是含程序脚本、参考文件与领域指示的模块包。元数据先索引,完整内容在任务计划需要时动态加载。

HarnessSkill schema 支持四种来源:

  • awsSkills:预先策展的 AWS 领域 skill,涵盖 SDK、IaC、安全、serverless、数据库与运营。

  • git:HTTPS 仓库,可钉选分支或 commit。

  • s3:从 Amazon S3 直接部署 skill 套件。

  • path:本地容器文件系统路径。

5. 沙箱运行时与持久存储

可链接 Amazon ECR 容器映像部署自定义依赖。开发者可用 InvokeAgentRuntimeCommand API 执行配置脚本,不消耗模型 token。

存储选项对应不同持久需求:

存储机制 托管 需要 VPC 持久范围
Managed Session Storage 在特定 runtimeSessionId 的 stop/resume 生命周期内持久。
Amazon EFS Access Point BYO 跨会话与 harness 共享持久存储。
Amazon S3 Files Access Point BYO 高耐久文件访问,含自动对象版本。

6. 可观测性、评估与优化回路

CloudWatch GenAI Observability 提供专用 Harnesses 仪表板。运营团队可把执行路径追到单一 span,涵盖记忆查询、浏览器会话、程序执行与工具调用。

内建评估元件支持自动化品控:

  • AgentCore Evaluations: 以 LLM-as-a-judge 评估 faithfulness、helpfulness、safety,可用批次数据集或实时流量。

  • AgentCore Optimization: 分析评估分数,建议优化系统 prompt 与工具描述,并经 AgentCore Gateway 做实时 A/B 路由验证。

7. 环境版本与程序导出

更新 harness 配置会建立不可变版本记录。正式端点可钉选明确版本,确保可靠回滚:

# Pin PROD Endpoint to Harness Version 2
aws bedrock-agentcore-control create-harness-endpoint \
  --harness-id harness-xyz123 \
  --endpoint-name PROD \
  --harness-version 2

# Promote Version 5 to PROD
aws bedrock-agentcore-control update-harness-endpoint \
  --harness-id harness-xyz123 \
  --endpoint-name PROD \
  --harness-version 5

若应用成长超出声明式配置,可把 harness 导出成程序:

agentcore export harness --name myHarness-xyz123 --output ./my-agent

导出程序基于开源 Strands 框架,保留 prompt 定义、记忆结构与工具绑定。


三种正式 Agent 配置模式

AgentCore Harness 的弹性可用三种标准正式部署模式说明:

模式 1:自动化研究与内容合成 Agent

  • 工具: agentcore_browser 搭配指向网页搜索端点的 AgentCore Gateway。

  • Skills:git 连接文档处理 skill 仓库。

  • 记忆: 默认托管记忆,保留多步骤研究上下文。

模式 2:企业云分析 Agent

  • Skills: 加载完整 awsSkills 套件。

  • 权限: 限定范围的 IAM 执行角色,访问 Athena、Glue、Redshift、CloudWatch。

  • 工具:agentcore_code_interpreter,在安全沙箱跑 Python 数据可视化。

模式 3:自动化软件开发 Agent

  • Runtime: 预载开发工具链的自定义 ECR 容器。

  • 工具: AgentCore Gateway 连到 GitHub/GitLab。

  • 执行:InvokeAgentRuntimeCommand 做可判定 Git 操作(clone、branch、commit),并搭配模型推理。


按用量计价结构

Amazon Bedrock AgentCore Harness 没有固定基本订阅费。账单严格按实际消耗计算:

指标 计价基础
Runtime Compute 每 vCPU-hour $0.0895每 GB-hour $0.00945,仅在实际计算时计量。
Browser & Code Interpreter 标准主动计算计量费率。
Gateway Invocations 每 1,000 次 API 请求与网页搜索计量。
Memory Storage & Access 每 1,000 短期事件、长期记录与检索计量。
Observability & Telemetry 标准 Amazon CloudWatch 用量费率。
Model Inference 标准 Amazon Bedrock 或外部模型供应商 token 费率。

全球客户实践

企业领袖在 Summit 面板分享正式环境实践:

  • Omar Paul(Twilio 产品副总): 「AgentCore Harness 搭配 Twilio Conversations,让全球客户能快速部署具上下文的语音与消息 agent,不必重建底层基础设施。」

  • Dr. Lukas Schack(TUI GROUP 首席机器学习工程师): 「AgentCore 是我们组织的基础积木。在 500+ 开发者的内部黑客松里,团队常在数分钟内把概念变成可运作原型。」

  • Rodrigo Moreira(VTEX 工程副总): 「从手写编排程序转成声明式 harness 配置后,团队用数分钟而非数天验证新电商顾客旅程。」

  • Kazumi Matsuda(FUJISOFT 资深经理): 「我们用 AgentCore 版本与 A/B 优化回路,在正式流量上做实时评估,再全面推出更新。」


动手开始:快速入门

选项 A:命令行界面(CLI)

# 1. Install global AgentCore CLI tool
npm install -g @aws/agentcore@preview

# 2. Initialize harness project definition
agentcore create --name research-agent --model-provider bedrock

# 3. Deploy infrastructure to AWS
agentcore deploy

# 4. Invoke agent endpoint
agentcore invoke "Plan a 5-day Tokyo itinerary with daily budgets and reservation links."

选项 B:Python SDK(boto3

import boto3
import uuid

# Initialize control and data clients
control = boto3.client("bedrock-agentcore-control", region_name="us-west-2")
data    = boto3.client("bedrock-agentcore",         region_name="us-west-2")

# Step 1: Create the Agent Harness definition
harness = control.create_harness(
    harnessName="FinancialAnalysisAgent",
    executionRoleArn="arn:aws:iam::123456789012:role/AgentCoreExecutionRole"
)

# Step 2: Invoke the Harness endpoint with session tracking
session_id = str(uuid.uuid4()).ljust(33, "0")  # Minimum required length: 33 characters

response = data.invoke_harness(
    harnessArn=harness["harnessArn"],
    runtimeSessionId=session_id,
    messages=[{
        "role": "user",
        "content": [{"text": "Summarize Q3 financial highlights from uploaded reports."}]
    }]
)

# Step 3: Stream responses in real time
for event in response["stream"]:
    print(event)


资深观点:引擎与整辆车

回顾数十年技术周期——从早期大型机、主从架构到现代云——AI 工程演化遵循熟悉模式:原始计算能力最终让位给运营管理与企业 harness 系统。

基础模型会持续快速演进。但工程团队建立的耐久价值,在于周围基础设施:运营护栏、记忆策略、评估回路与系统路由。

模型提供引擎,但 harness 造出完整车辆。刻意选择架构,为长期可扩展性而建。