Issue 01중국 AI
AC POST
중국 AI 목록
掘金2026년 9월 16일 23:06중국어 → 한국어

8개 서브에이전트로 2.3배 정보만 회수, 산출 보존 법칙

다중 에이전트 분해에서 8개 서브에이전트를 써도 정보가 2.3배만 늘어난 실험을 통해 분해 산출의 보존 법칙을 살펴본다.

중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.

다중 에이전트 시스템은 왜 work하는가? 업계에는 세 가지 설명이 떠돈다: 컨텍스트가 더 작다, 관심사 분리가 더 깔끔하다, 병렬화할 수 있다.

2026년 9월 15일 arXiv에 올라온 한 논문이 아무도 묻지 않았던 질문을 던졌다: 이 이유들은 모두 "분해가 각 agent를 더 살기 좋게 만든다"고 말하고 있는데, 그렇다면 분해한 뒤 리프 노드가 발견한 것 중 얼마나 실제로 루트 노드로 돌아오는가?

답은 C^k · N^{1-δ} 이다. 그리고 그중 가장 괴로운 추론 하나는: 만약 r(b) = 1/b 라면, 과제를 어떤 모양으로 쪼개든, 몇 층으로 쪼개든, 최종적으로는 정확히 1개의 발견만 되돌려받는다는 것이다. 저자는 20,000 그루의 무작위 불규칙 트리에서 이를 검증했고, 오차는 2.4×10⁻¹⁵ 였다.

이것은 "다중 에이전트가 나쁘다"는 논문이 아니다. 이것은 "당신은 병렬성을 사고 있다고 생각하지만, 실은 다른 두 가지를 사고 있는" 논문이다.

1. 세 가지 folklore, 그리고 아무도 묻지 않은 질문

어떤 다중 에이전트 아키텍처 설계 문서에서든 이 세 가지 이유를 찾을 수 있다:

| folklore 주장 | 그것이 답하는 질문 | |---|---| | 컨텍스트가 더 작다 | 각 하위 agent가 자기 몫만 보므로 전역 정보에 휩쓸리지 않는다 | agent가 터져버리지 않을까 | | 관심사 분리 | 각 하위 agent의 책임이 단일하여 간섭이 적다 | agent가 옆길로 새지 않을까 | | 병렬화 가능 | 여러 하위 agent가 동시에 돌아 벽시계 시간이 더 짧다 | 과제를 얼마나 오래 돌려야 하나 |

이 세 가지는 모두 맞고, 모두 프로덕션 데이터의 뒷받침이 있다. Anthropic은 자사의 다중 에이전트 리서치 시스템을 공개한 적이 있다: Opus가 lead, Sonnet이 worker를 맡아, 너비 우선(breadth-first) 리서치류 query에서 단일 agent Opus보다 90.2% 승리했고, 병렬화는 복잡한 과제의 리서치 시간을 최대 90% 단축시켰으며, token 사용량은 단일 채팅 상호작용의 약 15배 였다. 같은 자료에는 가장 많이 인용된 문장도 하나 있다: token 사용량 자체가 성능 분산의 80% 를 설명한다.

하지만 이 세 가지가 무엇에 대한 답인지 주목하라—— 그것들은 전부 "분해가 agent에게 좋다"고 말하고 있다.

어느 하나도 다음을 답하지 않는다: 분해가 "찾아낸 것"에게 좋은가.

deep research agent가 8개의 하위 agent를 나눠 자료를 조사하고, 각 하위 agent가 50개의 출처를 읽고 각자 요약 하나씩을 써서 돌려보낸다. 8개의 요약은 루트 노드에서 최종 보고서로 병합된다. 그렇다면 문제는: 8×50 = 400개의 출처에 담긴 정보 중 얼마나 최종적으로 보고서에 나타나는가?

직관은 "요약을 얼마나 잘 썼는지에 달려 있다"이다. 논문의 답은: 하나의 지수에 달려 있고, 그 지수는 agent의 속성이지 당신 아키텍처의 속성이 아니다.

2. 모델: 분해를 하나의 트리로 보고, "무엇이 빠졌는지"를 센다

2.1 유일한 가정

어떤 agent가 b개의 항목(items)을 넘겨받았을 때, 그것이 그중 임의의 한 항목을 남길(자기 출력에 쓰거나 상위로 전달할) 확률을 r(b) 라 하자.

이것이 전문의 유일한 모델링 가정이다. b는 당신이 그것에게 먹인 것이고, r(b)는 그것이 위로 올려보내는 것이다. 그 사이의 차이가 바로 이번 한 번의 전달에서 빠진 것 이다.

논문은 r(b)의 두 가지 형태를 고려한다:

형태 1: r(b) = 1/b

한 agent가 b개의 항목을 받으면, 각 항목이 남겨질 확률은 1/b이다. 그러면 기대 보존 개수는 b · (1/b) = 1개 이다.

이 가정 아래에는 좀 무서울 정도로 아름다운 결과가 하나 있다:

r( b ) = 1 / b ┌─────────────── 루트 agent ───────────────┐ │ │ ┌────┴────┐ ┌────┴────┐ │ 자식 A 자식 B 자식C 자식D ← 자식 노드가 몇 개든 ( b = 4 ) ( b = 4 ) ( b = 2 ) ( b = 2 ) ← 각자 몇 개를 받든 │ │ │ │ ┌┴┐ ┌┴┐ ┌┴┐ ┌┴┐ 리프리프 리프리프 리프리프 리프리프 ← 얼마나 깊든 ⇒ 최종적으로 루트에 전달되는 "발견" 수 = 1, 항상 일정

어떻게 쪼개든, 몇 층으로 쪼개든, 각 노드가 몇 개씩 나누든, 마지막에는 정확히 1개의 발견만 얻는다.

저자는 20,000 그루의 무작위 생성 불규칙 트리 에서 이를 검증했고, 이론값과의 편차는 2.4×10⁻¹⁵ 였다——이는 부동소수점 정밀도 수준으로, 수치적으로 정확히 성립한다는 뜻이다.

이 결과는 잠깐 멈춰볼 가치가 있다. 그것이 말하는 것은 "쪼갤수록 손실이 크다"가 아니라, **"쪼갤수록 손실이 크다"와 "쪼갤수록 커버리지가 넓다"라는 두 가지가 이 파라미터 아래에서 정확히 완전히 상쇄된다**는 것이다. 당신이 트리의 모양을 바꾼 것은 단지 "정보가 어느 경로에서 새는지"를 바꾼 것일 뿐, 새는 총량을 바꾸지는 않았다.

이것은 하나의 보존 법칙 이다.

형태 2: r(b) = C · b^(-δ)

1/b를 일반화한다. δ는 감쇠 지수, C는 b=1일 때의 상수 인자이다(왜냐하면 r(1) = C · 1^(-δ) = C 이므로).

깊이가 k인 트리, 총 N개의 발견을 커버한다고 하자(모두 분기 b라면 b^k = N). 매 층마다: 부모 노드는 b개의 자식 노드로부터 각각 내용을 받고, 보존 확률 r(b)로, 기대 보존 개수는 b · C·b^(-δ) = C·b^(1-δ) 개다. k층을 거치면:

yield = (C · b^( 1 -δ))^k = C^k · b ^(k( 1 -δ)) = C^k · N^( 1 -δ)

2.2 이 공식에서 가장 무서운 점: 두 인자가 분리된다

yield = C^k × N^( 1 -δ) ──── ─────── 아키텍처 항 과제 항 (당신이 통제 가능) (당신이 거의 통제 불가)

과제 규모 N과 아키텍처 k가 완전히 분리된다. 이것이 의미하는 바는:

아키텍처 쪽에서 당신이 곱할 수 있는 것은 기껏해야 C^k이고, C ≤ 1이다. 따라서 "산출량"이라는 지표만 보면, flat(계층 없음)이 영원히 최적이다. 층을 하나 더할 때마다 당신은 최소 1-C의 산출량을 확정적으로 잃는다. 어떤 agent 배치도 이것을 바꿀 수 없다.

δ는 agent의 속성이지, 아키텍처의 속성이 아니다. 그것이 기술하는 것은 "한 agent가 b개의 항목을 마주했을 때 얼마나 빠뜨리는가"이다. 아키텍처를 바꾸고, 층을 더하고, 토폴로지를 바꿔도 N^(1-δ) 라는 지수에서 도망칠 수 없다. δ를 바꾸고 싶다면, 아키텍처 그림을 바꾸는 게 아니라 agent를 바꿔야 한다.

한마디로 꿰뚫자면: 다중 에이전트 분해는 산출 상한을 높이지 못한다, 그것은 단지 "산출"이라는 지표를 다른 두 가지로 바꿔놓을 뿐이다. 그 두 가지가 무엇인지는 4절에서 다룬다.

3. 측정된 수치: δ = 0.34, C = 0.571, μ = 0.939

공식이 예쁜지 아닌지는 중요하지 않다, 중요한 것은 파라미터가 얼마인가이다. 논문은 프로덕션 데이터로 세 개의 수를 측정했다.

3.1 δ = 0.34: 당신의 agent는 출처를 4배 더 조사할 때마다 2.3배만 더 가져온다

말뭉치는 600건의 프로덕션 환경 deep-research 궤적 이다. 저자는 세 가지 서로 다른 실패 모드를 공유하지 않는 식별 방법 으로 δ를 교차 추정했고, 결과는 일치했다:

δ = 0.34, 95% CI [0.30, 0.38]

공식에 대입하면, N^(1-δ) = N^0.66 이다. 이것이 의미하는 바는:

| 시나리오 | 계산 | 결과 | |---|---|---| | 출처 수 ×4 (N → 4N) | 4^0.66, δ 상한 0.38 적용 → 4^0.62 | 2.3배만 더 가져옴 | | 마찬가지로 ×4, δ 점추정 0.34 적용 | 4^0.66 | 2.5배 | | 마찬가지로 ×4, δ 하한 0.30 적용 | 4^0.70 | 2.6배 |

한 리서치 agent가 하위 agent에게 4배 더 많은 출처를 조사하게 해도, 최종 보고서에는 약 2.3배의 내용만 더 늘어난다. 나머지는 층층이 요약되는 과정에서 빠져나간다.

이 숫자가 엔지니어링 의사결정에 주는 함의에 주목하라: 최종 보고서의 정보량을 두 배로 만들고 싶다면, 리프 노드의 작업량을 2^(1/0.66) = 2^1.515 ≈ 2.86배, 거의 3배로 늘려야 한다. 그리고 당신이 더 지불하는 돈은 3배이지, 2배가 아니다.

3.2 C = 0.571: 층을 하나 더할 때마다 산출이 반토막보다 조금 더 난다

C는 r(1)이다——agent가 1개의 항목을 받았을 때 그것을 보존할 확률. 어려운 점은: 어떻게 "항목"을 정의하고, 어떻게 agent가 그것을 "보존"했는지 아느냐이다.

저자는 매우 영리한 hop 하나를 골라 측정했다: 검색 도구가 b개의 번호가 매겨진 결과를 반환하고, agent가 한 라운드의 출력을 쓴다. 여기서 "항목 경계"는 (텍스트 휴리스틱이 아니라) 도구에 의해 주어지므로, 객관적으로 셀 수 있다.

- 말뭉치 규모: 16,082개의 hop

- 핵심: b = 1 인 경우가 550번 나타났다, 그래서 C = ρ(1)은 직접 관측값이지, 멱법칙에서 외삽한 것이 아니다

C = 0.571, 95% CI [0.527, 0.615]

층을 하나 더할 때마다 산출에 0.571을 곱한다. 즉 층마다 약 43% 손실이다.

두 층: 0.571² = 0.326 ——겨우 3할만 남는다. 세 층: 0.571³ = 0.186 ——2할도 안 된다.

3.3 μ = 0.939: "옆길로 새는" 세금이 하나 더 있다

위에서는 "빠뜨림"만 계산했다. 손실에는 또 다른 유형이 있다: 하위 agent가 brief를 잘못 이해해서 다른 것을 찾아갔다.

1,012건의 라벨링된 다중 에이전트 궤적 에서:

brief 16건마다 1건이 목표에서 벗어난다, 따라서 μ = 0.939

그래서 층을 하나 더할 때의 실제 비용은 C · μ 이다:

매 층의 실제 산출 계수 = C · μ = 0.571 × 0.939 = 0.536

층을 하나 더할 때마다 산출이 5.4할로 깎인다. 두 층이면 0.536² = 0.287, 세 층이면 0.154 다.

이 숫자는 모든 다중 에이전트 아키텍처 설계 문서의 표지에 적혀야 한다.

4. 그렇다면 왜 계층을 두는가: 당신은 다른 두 가지를 사고 있는 것이다

계층이 확정적으로 산출을 손실한다면, 왜 Anthropic의 시스템은 90.2% 승리할 수 있었는가? yield가 유일한 목적 함수가 아니기 때문이다. 논문은 계층을 두는 두 가지 정당한 이유를 지적하는데, 둘 다 yield 바깥에 있다.

4.1 루트 context는 유일하게 값싸게 잊을 수 없는 상태다

하위 agent의 컨텍스트는 쓰고 나면 버려진다. 하지만 루트 노드의 컨텍스트는 과제 전체를 관통하며, 그리고 그것은 "잊을" 수 없다——그것을 압축해줄 상위 계층이 없고, 그것이 종점이기 때문이다.

깊이가 k일 때, 루트 노드가 직접 마주하는 항목 수는 N에서 N^(1/k)로 줄어든다:

루트 노드가 직접 마주하는 항목 수 flat ( k = 1 ) ████████████████████████████████ N = 1000 k = 2 ██████ N^ 0.5 ≈ 32 k = 3 ██ N^ 0.33 ≈ 10

이것이 "컨텍스트가 더 작다"는 folklore의 진짜 가치이다—— 그것이 보호하는 것은 루트 노드이지, 하위 노드가 아니다. 하위 노드의 컨텍스트가 작든 말든 상관없다, 그것들은 쓰고 나면 파괴된다. 진짜로 터져버릴 수 있고, 터지면 구제할 방법이 없는 것은, 끝까지 살아남는 그 컨텍스트이다.

이는 업계에 이미 있는 관찰과 일치한다: 컨텍스트가 감쇠 구간에 들어가면, 모델이 중간 내용을 활용하는 능력이 현저히 떨어지고, 루트 노드의 컨텍스트는 "첫 1분부터 마지막 1분까지" 축적되는 유일한 것이다.

4.2 계층은 사실 더 저렴하다

append-only 컨텍스트는 비용이 O(N²)라고 생각하게 만든다. 하지만 논문은 프로덕션 데이터를 측정했다:

프로덕션 환경의 flat agent는 청구서가 N^1.39 로 증가하지, N²가 아니다

(실제 시스템에 이미 프리픽스 캐싱, 압축 등의 수단이 있어서 순수한 추가 방식이 아니라는 뜻이다.)

그리고 계층은 비용 면에서도 이득이 있다. 두 축(산출 손실 vs 비용 절감 + 루트 노드 보호)을 균형 잡으면, 논문은 닫힌 해(closed-form)의 최적 층수를 제시한다:

| 조건 | 최적 층수 | |---|---| | 논문이 실측한 프로덕션 파라미터 | 2–3층 | | 과제 규모가 14 자릿수(order of magnitude)를 넘어감 | 최적 층수는 단지 7층 증가 |

마지막 숫자가 핵심이다: 과제 규모가 14 자릿수 늘어도, 최적 층수는 단지 7층 만 는다. 아키텍처 선택은 극히 넓은 범위에서 둔감하다——"과제가 커졌다"는 사실 때문에 토폴로지를 다시 설계할 필요는 없다.

또 하나의 구체적 판정 기준: 동일 비용 조건에서, 두 층 구조는 N = 403개의 발견 지점에서 flat을 앞선다. 403개 미만의 발견 과제라면, flat이 더 이득이다.

5. 프로덕션 시스템은 무엇을 하고 있는가: 7.8%가 위임하고, 모델은 0.7%–11.3%가 가치 있다고 말한다

이론이 있으니, 저자는 마지막으로 실제 시스템을 검증한다: 현실의 multi-agent 시스템에서, 위임 행동이 이 모델에 부합하는가?

5.1 위임의 "당위"와 "실제"

실측 파라미터를 모델에 되돌려 대입해, "위임할 가치가 있는" session 비율을 계산하고, 실제로 발생한 비율과 비교한다:

모델이 말하는 "위임할 가치 있음" 비율 구간: 0.7 % ████████████░░░░░░░░░░░░░░░░ 11.3% ▲ 실제로 위임이 발생한 비율: 7.8 %

이 구간의 폭에 주목하라—— 0.7%에서 11.3%, 16배 차이 이다. 이것은 모델의 정밀도 문제가 아니라, 결론이 파라미터에 극도로 민감 하다는 것을 말한다. 당신은 논문의 숫자를 자기 시스템에 그대로 베껴서는 안 되고, 반드시 자신의 δ와 C를 측정해야 한다(방법은 7절에서 제시한다).

실제값 7.8%는 구간 안에 들어가므로, 모델이 현실에서 벗어나지 않았다는 뜻이지만, "정밀 예측"이라고 할 정도는 아니다.

5.2 가장 반직관적인 항목 하나: 위임은 "컨텍스트가 거의 찼다"에 대한 반응이 아니다

이 항목은 내가 보기에 전편에서 가장 엔지니어링 가치가 큰 발견이다.

직관은 우리에게 말한다. agent는 컨텍스트가 거의 다 차서야 "그럼 하위 agent를 하나 보낼까" 하고 생각하게 된다고. 이는 "컨텍스트 압력이 위임을 유발한다"는 심리 모델과 부합한다.

저자는 743,819회의 프로덕션 도구 호출로 이산시간 hazard model을 돌렸고, 결정 이전의 정보만 사용했다(결정 이후의 상태가 회귀에 새어 들어가는 것을 피하기 위해):

컨텍스트가 두 배가 될 때마다 위임이 발생할 odds ratio = 0.969, 95% CI [0.954, 0.985]

신뢰구간은 완전히 1 아래에 있다. 즉, 컨텍스트가 커져도 위임 확률이 높아지기는커녕 오히려 약간 낮아졌다.

결론: 위임은 오프닝 무브(opening move)이지, 비상 대응이 아니다. Agent는 과제를 시작할 때 이미 분배 여부를 결정하며, 컨텍스트가 버티지 못할 때까지 기다렸다가 분배하지 않는다.

이 결론이 아키텍처 설계에 주는 직접적 함의: 만약 시스템에 "컨텍스트 점유가 임계값을 넘으면 자동으로 하위 agent를 파생시킨다" 같은 로직을 구현했다면, 당신이 구현한 그 메커니즘은 실제 시스템에서 주요 분배 동인이 아니다. 그것이 유용할 수는 있지만, 그것이 모델링하는 것은 실제로 일어나는 그 과정이 아니다.

5.3 방법론적 경고

저자는 또한 아주 실질적인 말을 덧붙였다. 같은 회귀의 두 가지 소박한 버전이 내놓은 결과는 +0.65와 −0.37이었다.

부호가 뒤집힐 수도 있다.

이것이 바로 "결정 이전 정보만 사용"해야 하는 이유다. 일단 회귀에 결정 이후에 관측된 변수가 섞여 들어가면, 당신이 얻는 계수는 양수일 수도 음수일 수도 있으며, 어떻게 설정하느냐에 달려 있다. 어떤 "우리가 프로덕션 로그를 분석해 X가 Y를 유발한다는 것을 발견했다"는 결론이든, 먼저 물어야 한다. X는 Y 이전에 관측된 것인가, 이후에 관측된 것인가?

6. 다섯 개의 엔지니어링 난제(이 절이 결론보다 더 중요하다)

6.1 δ = 0.34는 deep-research 궤적 위의 숫자이지, 보편 상수가 아니다

600개의 프로덕션 궤적은 전부 deep research류 과제에서 나왔다. 당신의 워크로드가 코드 수정, 데이터 정제, 고객센터 티켓이라면 δ는 전혀 다른 수일 수 있다.

δ가 묘사하는 것은 "하나의 agent가 b개의 항목을 마주할 때의 보존율"이며, 태생적으로 과제 의존적이다. 0.34를 예산 산정에 쓸 수는 없다.

6.2 멱법칙 가정에는 "항목 간 시너지 없음"이 내포되어 있다

r(b) = C·b^(-δ)는 보존 확률이 오직 개수 b에만 의존하고 항목 간 내용 관계에는 의존하지 않는다고 가정한다. 그러나 현실에는 두 가지 상반된 상황이 존재한다:

- 정(正)시너지: 세 출처가 서로를 뒷받침하면, agent는 오히려 전부 기억하기가 더 쉬워진다(보존율이 멱법칙 예측보다 높다)

- 부(負)시너지: 열 개 출처가 고도로 중복되면, agent는 중복 제거를 하게 되어 실제로 보존되는 정보는 "10개의 발견"보다 훨씬 낮다

deep research는 후자에 속하는 경우가 많으며, 이것도 δ가 양수인 이유 중 하나다. 당신의 과제에서 항목들이 서로 독립적이라면, 멱법칙은 당신을 과소평가하고 있을 수 있다.

6.3 "발견"의 계수 기준이 δ를 결정한다

논문은 세 가지 식별 방법으로 단일 기준의 편향을 회피했고, 이 점은 아주 견실하게 해냈다. 그러나 세 방법 모두 결국 같은 코퍼스 위에서 돌아가므로, 코퍼스 차원의 편향을 공유한다.

예를 들어, 이 궤적들이 애초에 특정 deep research 제품에서 나온 것이라면, 그 요약 전략(고정적으로 5개 요점을 쓰라고 하는가?)이 세 가지 식별에 동시에 영향을 미친다.

6.4 C는 "항목 경계가 도구에 의해 주어지는" hop에서 측정되었다

저자 스스로 이 점을 강조했다. 선택한 hop은 "검색 도구가 b개의 번호 매겨진 결과를 반환하는" 것이었다. 여기서 b는 객관적이다.

하지만 많은 agent의 hop은 그렇지 않다. 항목 경계가 텍스트 휴리스틱에서 나온다(예: "이전 단락을 마침표로 잘라라"). 이런 hop에서의 C가 반드시 0.571인 것은 아니다. 저자의 정직함은 이 점을 명확히 밝힌 데 있지만, 당신이 그것을 없는 것처럼 가장할 수는 없다.

6.5 단일 저자, 단일 코퍼스, 미공개 시스템 신원

이 논문은 단일 저자(Rong He)의 작품이고, 코퍼스 출처는 이름이 밝혀지지 않은 프로덕션 시스템이다. 이는 결론이 성립하지 않는다는 뜻이 아니다. 오히려 반대로, 74만 회의 도구 호출 프로덕션 로그를 확보하는 것은 매우 드문 일이다. 하지만 이는 다음을 뜻한다:

- 다른 어떤 팀도 다른 시스템에서 δ = 0.34를 재현한 적이 없다

- 코퍼스의 선택 기준, 시간 창, 과제 분포가 모두 공개되지 않았다

- 결론은 정설이 아니라 하나의 가치 있는 첫 번째 데이터 포인트로 취급되어야 한다

7. 그럼 나는 어떻게 결정해야 하나: 먼저 자신의 δ와 C를 측정하라

7.1 한나절이면 다 돌려볼 수 있는 측정

C 측정(가장 간단): 당신 시스템에서 "도구가 번호 매겨진 목록을 반환 → agent가 한 라운드 출력을 쓴다"의 hop을 찾아라. b=1인 것들을 집계하거나(또는 회귀에서 직접 절편을 읽거나) 해서 agent의 보존율이 얼마인지 보라. 이것이 당신의 C다.

δ 측정(조금 더 번거로움): 아키텍처를 고정하고 N을 변화시켜라(예: 연구 범위를 ×2, ×4, ×8로). 최종 산출을 측정하라. log(yield)를 log(N)에 대해 회귀하면 기울기가 1-δ다.

log (yield) = k· log (C) + ( 1 -δ)· log (N) └──── 기울기, 바로 읽어낸다

μ 측정(가장 놓치기 쉬움): 하위 agent의 brief와 그것이 실제로 한 일을 표본으로 주석 달아, 이탈률을 보라. 1/16은 논문의 값이고, 당신의 것은 더 좋을 수도 더 나쁠 수도 있다.

7.2 의사결정 트리

당신의 과제에서, 리프 노드가 총 몇 개의 "발견" N을 만들어낼 것인가? │ ┌─────────────────────┼─────────────────────┐ │ │ │ N < ~ 50 N ≈ 50 – 400 N > ~ 400 │ │ │ ▼ ▼ ▼ 계층화하지 마라. 루트 노드 컨텍스트를 보라: 계층화, 2 – 3 계층. flat 단일 agent. ┌────┴────┐ 더 늘려도 가산되지 않고, 한 계층마다 5.4할씩 깎이며, │ │ 계층마다 또 5.4할씩 깎인다. 당신에게는 그렇게 깎을 산출이 없다. 버틴다 못 버틴다 │ │ ▼ ▼ flat 2 계층 (C·μ를 아낀다)

7.3 바로 실행할 수 있는 세 가지 규칙

"하위 agent가 산출한 발견 중 얼마나 최종 출력에 나타났는가"를 하나의 모니터링 지표로 만들어라. 대부분의 팀이 모니터링하는 것은 "하위 agent가 과제 몇 개를 완료했는가"이고, "그것이 발견한 것이 끝까지 살아남았는가"는 결코 모니터링하지 않는다. 그러나 후자가 시스템의 진짜 산출이다.

계층 간 전달에 스키마를 정하라. API에 스키마를 정하듯이. 10,000 토큰의 내부 작업을 하고 500 토큰의 구조화된 요약만 반환하는 하위 agent가 진정으로 컨텍스트를 아끼는 것이고, 8,000 토큰의 보고서를 반환하는 하위 agent는 나눈 것이나 다름없다. 압축은 "무엇을 반환하는가"에서 일어나지, "agent를 몇 개 파견했는가"에서 일어나지 않는다.

"컨텍스트 점유율이 X%를 넘으면 하위 agent를 파생시킨다"를 유일한 분배 전략으로 쓰지 마라. 74만 회 도구 호출의 증거는 실제 분배가 오프닝 결정이라고 말한다. 당신의 자동 분배 로직은 "과제 초반의 분류"에 참여해야 하며, "중도 비상 대응"에 참여해서는 안 된다.

8. 나의 판단

첫째, 이 논문이 종결하는 것은 멀티에이전트가 아니라, "잘게 쪼갤수록 좋다"는 기본 동작이다.

C^k · N^(1-δ)에서 가장 주목할 만한 것은 그 분가(分家)다. N^(1-δ)는 당신이 거의 건드릴 수 없고, C^k는 당신이 작게만 움직일 수 있다. 따라서 "산출을 위해 계층화한다"는 수학적으로 틀렸다. 계층화가 사들이는 것은 결코 산출이 아니다.

둘째, 계층화가 진짜로 사들이는 것은 "루트 노드의 생존"이다.

루트 노드 컨텍스트는 전 과정을 관통하는 유일한 상태이자, 값싸게 망각할 수 없는 상태다. N → N^(1/k)라는 이 감소가 계층화의 가치가 있는 곳이다. 이것은 또한 멀티에이전트가 폭 우선(breadth-first) 연구 과제에서 대승(90.2%)을 거두고도, 긴밀하게 결합된 코딩 과제에서는 그저 그런 성적을 내는 이유를 설명한다. 코딩 과제는 매 단계가 앞 단계에 의존하며, 당신은 자를 수 없고, 자르면 의존 관계를 함께 계층 간 전달로 넘겨야 하는데, 그 부분은 옮겨지지 않는다.

셋째, δ는 "정확도"와 나란히 놓이는 모델/agent 평가 지표가 되어야 한다.

우리가 지금 agent를 평가할 때 평가하는 것은 "그것이 맞게 할 수 있는가"다. 그러나 층층이 집계되는 시스템에서는 "그것이 얼마나 많은 것을 가지고 돌아올 수 있는가"가 또 하나의 독립적인 차원이다. δ = 0.34는 다음을 뜻한다: 당신이 δ = 0.2인 agent로 바꾸는 것이 하위 agent를 4배 더 파견하는 것보다 이득이다(N^0.8 vs N^0.66, N=1000일 때 251 vs 102, 2.5배 차이).

넷째, 가장 오용되기 쉬운 것은 그 7.8%다.

모델은 0.7%–11.3%가 위임할 가치가 있다고 말하는데, 실제로는 7.8%가 하고 있다. 이 숫자를 보면 가장 쉽게 나오는 결론은 "그러니까 우리는 거의 다 위임하고 있구나"이다. 그러나 구간 폭이 16배라는 것 자체가 말해 준다: 당신이 자신의 δ와 C를 측정하기 전까지, 이 숫자는 당신에게 아무런 지침적 의미가 없다. 논문의 가치는 당신에게 하나의 숫자를 준 데 있지 않고, 당신이 직접 숫자를 채워 넣을 수 있는 빈 표를 준 데 있다.

다음으로 볼 만한 신호: 다른 어떤 팀이 다른 프로덕션 시스템에서 δ를 재현하는가. 만약 δ가 서로 다른 시스템, 서로 다른 과제에서 안정적으로 0.3 근처에 떨어진다면, 그것은 agent의 준보편적 상수이며 교과서에 쓸 가치가 있다. 만약 그것이 과제 유형에 따라 크게 표류한다면, 그것은 각 시스템이 각자 교정해야 하는 엔지니어링량이다. 그리고 이 두 경우가 아키텍처 결정에 주는 함의는 완전히 다르다.

참고

- 주 논문: Rong He, Decomposition Buys Integrity, Not Yield, arXiv:2609.17464, 2026-09-15 제출(분류 cs.MA / cs.AI / cs.DC). 본문의 모든 공식, 파라미터와 실험 숫자는 해당 논문 초록 및 본문 HTML 버전에서 왔다. arxiv.org/abs/2609.17…

- 프로덕션 멀티에이전트 시스템의 공개 대조 데이터: Anthropic 멀티에이전트 연구 시스템(Opus lead + Sonnet workers): 폭 우선 연구류 query에서 단일 agent Opus 대비 승률 90.2%; 병렬화로 연구 시간 최대 90% 단축; 토큰 사용량은 단일 채팅 상호작용의 약 15배; 토큰 사용량이 성능 분산의 80%를 설명; 권장 동시 하위 agent 수 3–5. 이 데이터는 Anthropic 공개 엔지니어링 블로그 기준이며, 본문은 "벤더 자체 보고"로 취급한다.

- 컨텍스트 감쇠 배경: 긴 컨텍스트의 유효 활용률이 길이에 따라 하락하는 현상은 이미 여러 독립 연구가 있다(본문은 일일이 인용하지 않고, "루트 노드 컨텍스트는 왜 보호해야 하는가"의 정성적 배경으로만 삼는다).

데이터 출처와 면책 설명

- δ = 0.34 [0.30, 0.38], C = 0.571 [0.527, 0.615], μ = 0.939, N^1.39, "403 findings", "0.7%–11.3% vs 7.8%", "OR 0.969 [0.954, 0.985]", "74만 회 도구 호출"은 모두 arXiv:2609.17464에서 왔다.

- "4배 출처가 2.3배만 더 가지고 왔다"는 논문 초록 원문에서 취했다. δ 점추정 0.34로 계산하면 2.5배여야 하고, 2.3배는 CI 상한 δ=0.38에 대응한다. 본문은 구간(2.3–2.6배)을 함께 제시한다.

- 본문 중 "계층마다 약 43% 손실""5.4할로 깎인다"는 C와 C·μ에서 직접 계산해 낸 것이며, 논문 원문 표현은 아니다.

- 해당 논문은 단일 저자 작품이고, 프로덕션 코퍼스는 이름이 밝혀지지 않은 시스템에서 왔으며, 아직 독립적 재현이 없다. 모든 파라미터는 보편 상수가 아니라 "첫 번째 데이터 포인트"로 취급해야 한다.

- Anthropic 멀티에이전트 데이터는 벤더 엔지니어링 블로그 자체 보고 기준이며, 동료 심사 결과가 아니다.

- 본문은 논문 방법에 대한 독립적 검증을 하지 않았으며, 모든 결론의 적용 가능성은 독자가 자신의 시스템에서의 실측을 기준으로 한다.

米小虾

대모델 개발 엔지니어

247

143k

읽음

50