AWS Hong Kong Summit 2026 · Developer Lounge 精華回顧

Agent Harness 才是真正的工程護城河

AWS Hong Kong Summit 2026 · Developer Lounge 精華回顧 · 第 2 / 6 篇

AWS Magazine · 維多利亞港現場報導


高科技遇上海港奢華:Developer Lounge 現場氣氛

踏進 AWS Hong Kong Summit 2026 Developer Lounge,能量幾乎可觸。落地玻璃框住維多利亞港全景,遊艇在正午陽光反射的水面滑過。室內把香港招牌奢華感與超現代雲端創新無縫接在一起。從舊金山、東京、倫敦、西雅圖飛來的工程師、創辦人與科技領袖,陷進天鵝絨沙發,一邊喝手工 espresso,一邊湊近發光螢幕。

這裡不只是拿貼紙或看預錄 demo 的地方,而是商業協作與激烈技術交流的震央。主舞台周圍的玻璃 VIP 廂房裡,創投與新創創辦人進行私人聚會。對話充滿高風險財務動態——一邊談種子輪(money in),一邊談生產基礎設施燒錢速度(money out)。白板牆上,staff architect 與獨立 builder 畫出複雜系統拓撲,討論如何把原始模型智慧轉成企業級軟體。

+-----------------------------------------------------------------------------------+
AWS HONG KONG SUMMIT 2026 DEVELOPER LOUNGE

[ 海港景觀 VIP 角落 ]              [ 白板架構區 ]
  - 私人聚會與提案                   - 模型花費 vs harness 護城河
  - Money in / money out             - 即時程式碼與架構對談

[ 動手 Lab 與 Espresso Bar ]       [ 主舞台與閃電講 ]
  - Managed memory 與 CLI 設定       - Trista Pan agent harness 主題演講
  - 動手體驗 AWS AgentCore GA        - 國際講者面板
+-----------------------------------------------------------------------------------+

開場:Lounge 從 Demo 轉向正式上線

若說 2025 年香港 AWS AI 場景像整晚煙火——到處是亮眼 agent 原型、每週 demo、社群貼文秀模型能力——那麼 AWS Summit Hong Kong 2026 標誌營運成熟度的到來。Lounge 裡迴盪的核心問題不再是「看模型能做什麼」,而是關鍵的生產問題:你要如何安全地把 agent 送進正式環境?

在 Developer Lounge,這個問題的焦點落在 Trista Pan 那場站無虛席的閃電講。工程師與顧問夥伴擠在白板前辯論一個中心前提:模型花費是 money out;harness engineering 是會複利的錢。

原始長文(builder.aws.com): Agent Harness: Where Engineers Add Value When Models Keep Getting Smarter

演講同期,AWS 宣布 Amazon Bedrock AgentCore Harness 正式上市(GA)——提供模型自己吸收不了的生產營運層。

GA 公告: Amazon Bedrock AgentCore harness is now generally available


隨著 AI 模型成熟,工程槓桿正從裸模型轉向 agent harness——圍繞模型、把價值導向使用者與 builder 的鷹架。2025 年產業用快速原型證明 agent 能力;2026 年焦點成熟為營運控管與可靠性。分析師 Aakash Gupta 一句話總結:「2025 was agents;2026 is agent harnesses。」真正價值,來自讓 agent 在正式環境可靠運作。


氣氛轉變:從「做得出來嗎?」到「跑得起來嗎?」

模型愈來愈強時,工程槓桿正移向周圍鷹架——價值要嘛 向外服務客戶,要嘛 向內服務 builder

  • 去年,agent 在各產業全面爆發,每週都有新 demo。

  • 2025 年主流問題是「我們能不能做一個會做 X 的 agent?」,答案幾乎都是可以。

  • 今年問題成熟了:快速起一個簡單 agent 很容易,但要把週末原型變成正式系統,需要 可靠性與營運控管

正如 Aakash Gupta 所說:「2025 was agents;2026 is agent harnesses。」


公式:Agent = Model + Harness

延續 Vivek Trivedy 在 The Anatomy of an Agent Harness 的框架,現代 AI 應用的核心架構身分可用一句簡單公式表達:

Agent = Model + Harness

若某個元件不是核心基礎模型本身,它就屬於 harness。工具、記憶、prompt engineering、編排、可觀測性、護欄、路由、部署,全屬 harness engineering。系統性地設計這套 harness,並把營運失敗轉成永久系統修正——Mitchell Hashimoto 常強調的方法——正是 harness engineering 這門學科。

Lounge 裡最容易聽懂的汽車比喻

為了讓新手直覺理解,現場講者用經典汽車比喻:

  • 模型是引擎:產生動力、推理、規劃與原始驅力。

  • 但你不能把地板上的裸引擎交給駕駛。

  • 可上路車輛還需要底盤、方向盤、煞車、儀表、安全帶與大燈。

  • 引擎產生動力,harness 才把動力轉成日常可用、安全可靠的車。

高效能模型不保證成功的正式 agent,正如強勁引擎不保證安全汽車。

奢華餐飲比喻

香港頂級餐廳從不只靠高級爐火;成功仰賴訂位管理、廚房協調、品管與接待。AI 架構亦然:模型是火焰,harness 是整套營運管理。


Harness 有兩半

Agent harness 的職責平均分在建置期能力與執行期營運:

半邊 主要功能 工程心態
Development(開發) 延伸模型能力:跨工作階段持久記憶、Model Context Protocol(MCP)工具整合、檢索增強上下文、系統 prompt 架構、規劃與任務編排。 Builder 工藝與架構
Operations(營運) 確保企業可靠性:端到端可觀測性、評估迴路、護欄強制、模型路由、成本/漂移監控、部署管線與自動擴縮。 經典雲端營運

Martin Fowler 團隊正式把這門技術學科稱為 harness engineering。把應用能力分類時,只有一小部分屬於模型本身,絕大多數屬於 harness 層。


真實證據:同一模型,更好的 Harness

面對「等更強模型就好」的質疑,講者分享實證:在 模型不變 的前提下,只優化 harness 基礎設施。

1. Vercel v0 — 更少上下文,更高效率

大 context window 需要主動管理,否則過期資訊會拖垮表現。Vercel v0 團隊把主動工具集從 15 個砍到 2 個核心 primitive(bash 與檔案系統)。

  • 準確率:80% 升到 100%

  • Token 花費: 下降約 37%

  • 延遲: 回應快約 3.5 倍

2. LangChain on Terminal Bench 2.0

加上明確 harness 元件——自我驗證迴路、完成前檢查清單、迴圈偵測——在相同模型後端上:

  • 基準分數:52.8% 跳到 66.5%

  • 排名: 約從前 30 進入前 5。

3. 更小模型打敗旗艦模型

  • Hebia: 把 GPT-5.4 mini 放進金融與法律專用 harness,通過率與來源歸因勝過未加 harness 的旗艦模型,token 成本更低。

  • MIT CSAIL Recursive Language Models: 把 GPT-5-mini 包進可對上下文片段遞迴呼叫自身的架構(無需 fine-tune),基準 64.9% vs 30.3%,對上明顯更大的模型配置。


模型會不會把 Harness 吞掉?

開發者常見擔心:基礎模型快速進步,會不會讓 harness engineering 變多餘?

模型正在吸收什麼

某些低階工作愈來愈常由新模型原生處理:

  • 上下文處理: 擴大 context window 降低手動切塊負擔。

  • 規劃: 進階推理模型可維持長程連貫,不必複雜手動 sprint 拆解;Addy Osmani 指出這大幅減少 context-anxiety 失敗模式。

  • 基本自我修正: 拒絕模式與基本輸出驗證愈來愈內建於裸模型。

為什麼營運層仍然不可或缺

Harness 會往軟體堆疊更高層移動。核心營運責任——模型路由、基礎設施擴縮、成本追蹤、安全強制、遙測——仍與裸模型智慧不同。

關鍵收穫: 模型沒辦法當自己的多供應商路由器、基礎設施擴縮器,或成本治理引擎。

+-----------------------------------------------------------------------------------+
EVOLUTION OF THE AGENT HARNESS STACK

Operations Layer(成長)
  - 多模型路由與成本優化
  - 護欄強制與可判定權限
  - 分散式追蹤與 CloudWatch 可觀測性

Model Layer(吸收低階任務)
  - 擴大 context window 與基本規劃
  - 原生函式呼叫與基本自我修正
+-----------------------------------------------------------------------------------+

元件演化分析

元件 被吸收/淘汰的能力 持續成長的高槓桿責任
Memory 單工作階段暫存草稿。 多工作階段持久化、跨 agent 狀態共享、知識圖譜。
Tools / MCP 複雜工具包裝定義。 原子執行 primitive、MCP 生態、動態工具組裝。
Planning 短期上下文拆解。 多日執行、長程相依追蹤、適應性規劃。
Context 基本 prompt stuffing 與簡單 RAG。 漸進式上下文揭露、上下文品質策略、遞迴上下文處理。
Prompts 單體 prompt 文字塊。 階層規則定義、測試驅動指示檔、rules-as-code。
Observability 簡單 console.log。 分散式追蹤管線、trace mining、語意執行分析。
Evaluation 臨時手動 prompt 評估。 外層評估迴路、領域測試套件、自動化 LLM-as-judge。
Guardrails 軟性 prompt 約束(「請不要……」)。 可判定 hook、權限閘道、建置管線整合。
Routing 靜態單一模型綁定。 跨供應商動態成本/品質路由。
Deployment 單腳本本機執行。 沙箱環境、機群回復、生命週期管理。

AI 工程團隊的策略方向

鼓勵開發者與新創刻意選擇兩大策略之一:

  1. 方向 A — 向外服務客戶: 專注產品設計、使用者體驗與領域解題。用託管 harness 搭配前沿模型,小團隊也能以更低人力交付複雜應用。

  2. 方向 B — 向內服務 Builder: 打造可重用開發工具、自訂 middleware、評估迴路與領域路由基礎設施。這會創造跨多代模型仍保值的長期價值。


深潛:Amazon Bedrock AgentCore Harness GA

隨著 Amazon Bedrock AgentCore Harness 正式上市,AWS 提供託管基礎設施抽象,簡化 agent 正式部署。

+-----------------------------------------------------------------------------------+
AMAZON BEDROCK AGENTCORE HARNESS (GA)

API 介面:CreateHarness / InvokeHarness

Harness 底下的原語
  - Runtime       運算
  - Memory        語意狀態
  - Gateway       API / MCP 工具
  - Browser       網頁沙箱
  - Interpreter   Python / Node 沙箱
  - Identity      憑證保管庫

可觀測性:CloudWatch 統一 harness 追蹤
+-----------------------------------------------------------------------------------+

架構總覽與關鍵能力

延續 Simon Willison 的定義——「LLM agent 在迴圈中執行工具以達成目標」——AgentCore Harness 簡化周圍營運負擔。本機原型 agent 迴圈很容易,但正式環境傳統上要管沙箱運算、網路隔離、身分保管、工作階段持久化與分散式追蹤。AgentCore Harness 用兩個核心 API——CreateHarnessInvokeHarness——取代自建基礎設施。

1. 多模型彈性與供應商切換

AgentCore Harness 把 agent 設定與單一模型供應商解耦。開發者可定義預設模型,並在每次呼叫動態覆寫,或在工作階段中途切換供應商且保留對話狀態。

支援的模型供應商包括:

  • bedrock:存取 Amazon Bedrock 上的模型,含 Anthropic Claude、Amazon Nova、Meta Llama、DeepSeek、Qwen、Kimi、MiniMax、Cohere、Mistral,以及 Bedrock 上的 OpenAI GPT-5.5、GPT-5.4。

  • openAi:直連 OpenAI API(api.openai.com)。

  • gemini:直連 Google Gemini API。

  • liteLlm:通用第三方端點整合,含 Azure OpenAI、Vertex AI、Cohere 與自架端點。

外部模型供應商的 API 金鑰由 AgentCore Identity token vault 管理,避免憑證暴露在原始模型上下文。

2. 宣告式工具整合

工具在建立 harness 時以 tools 陣列結構化宣告:

"tools": [
  { "type": "agentcore_browser" },
  { "type": "agentcore_code_interpreter" },
  { 
    "type": "remote_mcp",
    "name": "X_tool",
    "config": { "remoteMcp": { "url": "https://mcp.X_tool/mcp" } } 
  },
  { 
    "type": "agentcore_gateway",
    "name": "Y_tool",
    "config": { "agentCoreGateway": { "arn": "arn:aws:bedrock-agentcore:us-west-2:123456789012:gateway/gw-xyz" } } 
  }
]

每個執行工作階段都自動具備原生 shellfile_operations,不必手動包工具。可用 InvokeHarnessallowed_tools 在執行期選擇性允許或限制工具。

3. 託管工作階段記憶

CreateHarness 時若省略明確 memory 旗標,會自動布建具企業預設的託管記憶:

  • 策略: 結合 SEMANTIC 索引與 SUMMARIZATION 處理。

  • 資料保留: 預設事件 30 天過期(可設定)。

  • 安全: AWS 託管加密,並以 actorId 做租戶隔離。

// Example: Managed Memory Configuration
"memory": {
  "managedMemoryConfiguration": {
    "strategies": ["SEMANTIC", "SUMMARIZATION"],
    "eventExpiryDuration": 30
  }
}

// Example: Bring Your Own Memory ARN
"memory": { 
  "agentCoreMemoryConfiguration": { 
    "arn": "arn:aws:bedrock-agentcore:us-west-2:123456789012:memory/mem-abc" 
  } 
}

// Example: Stateless Execution
"memory": { "disabled": {} }

4. 模組化 Skill 整合

Skills 是含程式腳本、參考檔與領域指示的模組包。中繼資料先索引,完整內容在任務計畫需要時動態載入。

HarnessSkill schema 支援四種來源:

  • awsSkills:預先策展的 AWS 領域 skill,涵蓋 SDK、IaC、安全、serverless、資料庫與營運。

  • git:HTTPS 儲存庫,可釘選分支或 commit。

  • s3:從 Amazon S3 直接部署 skill 套件。

  • path:本機容器檔案系統路徑。

5. 沙箱執行期與持久儲存

可連結 Amazon ECR 容器映像部署自訂相依。開發者可用 InvokeAgentRuntimeCommand API 執行設定腳本,不消耗模型 token。

儲存選項對應不同持久需求:

儲存機制 託管 需要 VPC 持久範圍
Managed Session Storage 在特定 runtimeSessionId 的 stop/resume 生命週期內持久。
Amazon EFS Access Point BYO 跨工作階段與 harness 共享持久儲存。
Amazon S3 Files Access Point BYO 高耐久檔案存取,含自動物件版本。

6. 可觀測性、評估與優化迴路

CloudWatch GenAI Observability 提供專用 Harnesses 儀表板。營運團隊可把執行路徑追到單一 span,涵蓋記憶查詢、瀏覽器工作階段、程式執行與工具呼叫。

內建評估元件支援自動化品管:

  • AgentCore Evaluations: 以 LLM-as-a-judge 評估 faithfulness、helpfulness、safety,可用批次資料集或即時流量。

  • AgentCore Optimization: 分析評估分數,建議優化系統 prompt 與工具描述,並經 AgentCore Gateway 做即時 A/B 路由驗證。

7. 環境版本與程式匯出

更新 harness 設定會建立不可變版本紀錄。正式端點可釘選明確版本,確保可靠回滾:

# Pin PROD Endpoint to Harness Version 2
aws bedrock-agentcore-control create-harness-endpoint \
  --harness-id harness-xyz123 \
  --endpoint-name PROD \
  --harness-version 2

# Promote Version 5 to PROD
aws bedrock-agentcore-control update-harness-endpoint \
  --harness-id harness-xyz123 \
  --endpoint-name PROD \
  --harness-version 5

若應用成長超出宣告式設定,可把 harness 匯出成程式:

agentcore export harness --name myHarness-xyz123 --output ./my-agent

匯出程式基於開源 Strands 框架,保留 prompt 定義、記憶結構與工具綁定。


三種正式 Agent 設定模式

AgentCore Harness 的彈性可用三種標準正式部署模式說明:

模式 1:自動化研究與內容合成 Agent

  • 工具: agentcore_browser 搭配指向網頁搜尋端點的 AgentCore Gateway。

  • Skills:git 連接文件處理 skill 儲存庫。

  • 記憶: 預設託管記憶,保留多步驟研究上下文。

模式 2:企業雲端分析 Agent

  • Skills: 載入完整 awsSkills 套件。

  • 權限: 限定範圍的 IAM 執行角色,存取 Athena、Glue、Redshift、CloudWatch。

  • 工具:agentcore_code_interpreter,在安全沙箱跑 Python 資料視覺化。

模式 3:自動化軟體開發 Agent

  • Runtime: 預載開發工具鏈的自訂 ECR 容器。

  • 工具: AgentCore Gateway 連到 GitHub/GitLab。

  • 執行:InvokeAgentRuntimeCommand 做可判定 Git 操作(clone、branch、commit),並搭配模型推理。


依用量計價結構

Amazon Bedrock AgentCore Harness 沒有固定基本訂閱費。帳單嚴格依實際消耗計算:

指標 計價基礎
Runtime Compute 每 vCPU-hour $0.0895每 GB-hour $0.00945,僅在實際運算時計量。
Browser & Code Interpreter 標準主動運算計量費率。
Gateway Invocations 每 1,000 次 API 請求與網頁搜尋計量。
Memory Storage & Access 每 1,000 短期事件、長期紀錄與檢索計量。
Observability & Telemetry 標準 Amazon CloudWatch 用量費率。
Model Inference 標準 Amazon Bedrock 或外部模型供應商 token 費率。

全球客戶實作

企業領袖在 Summit 面板分享正式環境實作:

  • Omar Paul(Twilio 產品副總): 「AgentCore Harness 搭配 Twilio Conversations,讓全球客戶能快速部署具上下文的語音與訊息 agent,不必重建底層基礎設施。」

  • Dr. Lukas Schack(TUI GROUP 首席機器學習工程師): 「AgentCore 是我們組織的基礎積木。在 500+ 開發者的內部駭客松裡,團隊常在數分鐘內把概念變成可運作原型。」

  • Rodrigo Moreira(VTEX 工程副總): 「從手寫編排程式轉成宣告式 harness 設定後,團隊用數分鐘而非數天驗證新電商顧客旅程。」

  • Kazumi Matsuda(FUJISOFT 資深經理): 「我們用 AgentCore 版本與 A/B 優化迴路,在正式流量上做即時評估,再全面推出更新。」


動手開始:快速入門

選項 A:命令列介面(CLI)

# 1. Install global AgentCore CLI tool
npm install -g @aws/agentcore@preview

# 2. Initialize harness project definition
agentcore create --name research-agent --model-provider bedrock

# 3. Deploy infrastructure to AWS
agentcore deploy

# 4. Invoke agent endpoint
agentcore invoke "Plan a 5-day Tokyo itinerary with daily budgets and reservation links."

選項 B:Python SDK(boto3

import boto3
import uuid

# Initialize control and data clients
control = boto3.client("bedrock-agentcore-control", region_name="us-west-2")
data    = boto3.client("bedrock-agentcore",         region_name="us-west-2")

# Step 1: Create the Agent Harness definition
harness = control.create_harness(
    harnessName="FinancialAnalysisAgent",
    executionRoleArn="arn:aws:iam::123456789012:role/AgentCoreExecutionRole"
)

# Step 2: Invoke the Harness endpoint with session tracking
session_id = str(uuid.uuid4()).ljust(33, "0")  # Minimum required length: 33 characters

response = data.invoke_harness(
    harnessArn=harness["harnessArn"],
    runtimeSessionId=session_id,
    messages=[{
        "role": "user",
        "content": [{"text": "Summarize Q3 financial highlights from uploaded reports."}]
    }]
)

# Step 3: Stream responses in real time
for event in response["stream"]:
    print(event)


資深觀點:引擎與整輛車

回顧數十年技術週期——從早期大型主機、主從架構到現代雲端——AI 工程演化遵循熟悉模式:原始運算能力最終讓位給營運管理與企業 harness 系統。

基礎模型會持續快速演進。但工程團隊建立的耐久價值,在於周圍基礎設施:營運護欄、記憶策略、評估迴路與系統路由。

模型提供引擎,但 harness 造出完整車輛。刻意選擇架構,為長期可擴展性而建。