Conductor: 지시와 전달 경로를 학습한다

Learning to Orchestrate Agents in Natural Language with the Conductor — Stefan Nielsen 외

목차

같은 코딩 문제를 세 모델에 보내고 답을 모았는데 가장 정확했던 모델의 답이 최종 정리에서 틀린 답으로 바뀔 수 있다. 다수의 답을 받는 일과 어느 답의 어떤 근거를 다음 단계에 넘길지 정하는 일은 다르다. 협업의 품질을 높이려면 작업자 선택, 구체적인 지시, 정보 전달 경로를 함께 다뤄야 한다.

Stefan Nielsen 외의 Learning to Orchestrate Agents in Natural Language with the Conductor는 조정자 자체를 학습한다. 2025년 12월 처음 제출된 논문의 2026년 5월 6일 개정판인 arXiv v5를 기준으로 읽었다. 70억 개 매개변수의 조정자가 더 큰 작업자 모델들을 이용해 답을 만드는 연구이며 작은 모델 하나가 작업자 없이 같은 성능을 낸다는 뜻은 아니다.

경로 문제에서 같은 질문을 세 번 보내면 무엇이 남을까

다음은 논문 데이터를 사용하지 않고 구성한 가상 문제다. 출발점 S에서 목적지 T까지 최소 비용 경로를 구한다. 간선과 비용은 S→A에 2, A→T에 2, S→T에 5다. 비용은 음수가 아니고 방향은 화살표 방향으로만 이동할 수 있다.

정답은 S→A→T, 총비용 4다. 하지만 작업자 한 명이 직접 간선만 보고 S→T의 비용 5를 고르면 최종 정리 담당은 근거를 확인해야 그 오류를 고칠 수 있다. “세 답을 참고하라”라는 지시만으로는 경로 계산과 출력 형식 검사가 누가 맡을지 정해지지 않는다.

Conductor의 출력은 세 요소를 가진 단계들의 목록이다. 하위 작업은 자연어 지시, 작업자 ID는 수행할 모델, 접근 목록은 앞선 단계에서 무엇을 보여 줄지다. 기본 실험의 접근 목록은 앞선 결과를 모두 보는 all과 아무것도 보지 않는 빈 목록을 사용한다. 원문은 특정 단계들만 고르는 더 세밀한 변형도 시험했지만 기본 방식보다 유의미한 성능 향상을 얻지 못해 단순한 방식을 선택했다.

가상 경로 문제를 이 구조로 표현하면 다음처럼 읽을 수 있다. 표의 작업자 역할과 지시는 이 글에서 만들었으며 실제 Conductor가 생성한 출력은 아니다.

단계하위 작업의 지시작업자앞선 결과의 접근
1모든 가능한 S→T 경로와 비용을 계산하라.경로 계산 담당빈 목록: 원래 문제만 본다.
2방향과 비용을 독립적으로 확인하고 최소 경로를 계산하라.독립 검산 담당빈 목록: 1단계 답을 보지 않는다.
3두 계산을 대조하고 경로와 총비용만 반환하라.최종 출력 담당all: 앞선 두 결과를 모두 본다.

1단계가 비용 5를 골라도 2단계는 그 결론에 끌리지 않고 비용 4를 계산할 수 있다. 3단계는 답의 개수가 아니라 2 + 2 < 5라는 근거로 판단한다. 반대로 구현에 계산 담당의 계획이 꼭 필요한 문제라면 다음 작업자에게 앞선 결과를 보여 주는 연쇄 구조가 더 적합하다. 접근 목록은 독립 탐색을 유지할 곳과 앞선 근거를 이어받을 곳을 구분하는 장치다. Conductor 원문

여기서 독립은 컨텍스트의 의미다. 기본 구현은 작업 흐름을 순서대로 실행한다. 1·2단계가 서로의 답을 보지 않는 구조를 만들 수 있다는 사실이 두 호출의 실제 병렬 실행이나 지연 감소를 증명하지는 않는다.

조정자는 자기 계획을 잘 썼는지보다 마지막 답으로 배운다

Conductor는 정답이 있는 문제에서 후보 작업 흐름을 생성하고 실제 작업자들을 호출한 마지막 답을 채점한다. 정해진 목록을 파싱할 수 없으면 보상은 0, 형식을 지켰지만 최종 답이 틀리면 0.5, 최종 답이 맞으면 1이다. “누구에게 무엇을 시킬지”를 최종 성공에 연결해 학습하는 구조다.

학습에는 GRPO를 사용한다. 같은 질문에서 여러 후보 결과를 만들고 후보가 그룹 평균보다 얼마나 나은 보상을 받았는지 비교해 생성 정책을 조정하는 강화학습 방법이다. 이 연구에서 보상 대상은 조정자의 텍스트 자체만이 아니라 그 텍스트로 실행한 협업의 결과다. 가상 경로 예제에서 긴 계획을 쓰더라도 최종 출력이 비용 5라면 짧은 계획으로 비용 4를 반환한 후보보다 낮은 보상을 받는다.

기본 모델은 Qwen2.5-7B이며 수학, 지식, 추론, 코드 문제 960개를 이용해 200회 학습한다. 한 흐름은 최대 다섯 단계다. 연구의 작업자 풀에는 GPT-5, Gemini 2.5 Pro, Claude Sonnet 4와 공개 가중치 모델들이 포함된다. 보상에 호출 비용을 직접 벌점으로 넣지는 않았는데도 평균 약 세 단계의 흐름을 학습했다고 보고한다. 이 관찰을 예산 제한이 자동으로 보장된다는 주장으로 바꿔서는 안 된다. Conductor 원문

이 학습이 가능한 이유는 작은 조정자가 처음부터 문제를 혼자 풀 필요가 없기 때문이다. 강한 작업자를 적절히 호출하는 후보가 하나라도 나오면 최종 정답 보상을 받을 수 있다. 같은 질문의 후보들 중 그 흐름을 더 자주 만들도록 학습할 수 있다. 저자들은 이를 작은 모델의 탐색 부담을 줄이는 이유로 설명한다. 작업자는 학습할 조정자의 행동이 환경에 미치는 결과를 만들어 주며 70억 매개변수라는 크기는 이 전체 시스템의 크기를 나타내지 않는다. 조정자 학습과 평가

그러나 마지막 정답만으로는 어느 지시나 정보 전달이 성공을 만들었는지 구분하기 어렵다. 맞는 답을 낸 두 흐름이 같은 보상을 받으면 더 짧은 흐름을 직접 선호하는 신호도 없다. 형식을 지킨 오답에 주는 0.5는 파싱 가능한 계획을 배우게 하지만 잘못된 전제를 찾아 수정했는지를 따로 평가하지 않는다. 실행 가능한 계획을 배우는 일, 좋은 답을 얻는 일, 비용을 줄이는 일은 이 보상에서 서로 다른 정도로 지원된다. 평균 세 단계는 학습 결과로 관찰한 경향이고 명시적으로 최적화한 비용 목표가 아니다.

출력 길이를 맞춘 비교와 최대 성능 비교는 다르다

논문에는 서로 다른 두 평가가 있다. 최대 출력 길이와 추론 예산을 사용해 기존 최고 결과와 비교하는 평가, 작업자의 출력을 4,096토큰으로 제한하고 추론 예산을 최소로 맞춘 평가다. 다음 표는 두 번째 제한된 설정의 저자 보고값이다. 첫 번째의 더 높은 점수를 섞지 않았다.

표는 원문 표 7에서 주요 행을 골라 각 문제 집합의 평균 정확도만 옮겼다. 단위는 %이며 높을수록 좋다. 원문에 있는 과제별 표준오차와 나머지 모델·변형은 생략했다. MATH500은 수학, MMLU는 객관식 지식, RLPR은 추론, LiveCodeBench는 코드 생성 평가다. 평균은 네 과제의 정확도를 동일하게 평균한 값으로, 문제 수를 합쳐 계산한 전체 정답률은 아니다.

구성MATH500MMLURLPRLiveCodeBench과제 평균
Gemini 2.5 Pro, 단일 호출85.3091.5339.5740.1464.14
GPT-5, 단일 호출74.4589.7933.1357.5063.72
GPT-5, 최대 5회 자기 수정76.9391.7931.8057.5764.52
MoA, 여러 답의 집계83.1088.4638.3738.5762.13
MASRouter80.6086.2832.8027.8656.89
Conductor89.3393.1442.6364.2972.35

출처: Conductor 원문. 직접 재현한 측정값은 아니다.

Conductor의 LiveCodeBench는 64.29%다. GPT-5 단일 호출의 57.50%보다 6.79%포인트 높다. 반면 MoA는 GPT-5보다 낮은 38.57%다. 저자들은 약한 후보들의 틀린 답이 최종 집계를 잘못 이끈 실행을 분석했다. 여러 답을 모은다는 사실만으로 좋은 답이 보존되지는 않는다는 관찰이다.

그렇다고 이 표가 조정자의 모든 선택이 항상 옳음을 보여 주지는 않는다. 결과는 정답 검증이 가능한 문제 분포와 해당 작업자 풀, 토큰 제한에서 나온다. 상용 서비스에서 사용자가 모호한 선호를 제시하거나 도구 상태가 바뀌는 작업에 같은 개선 폭이 나온다고 말할 수 없다.

정확도가 높아도 모든 기준보다 싸지는 않다

원문 표 6은 네 과제에서 평균 성능, 문제당 토큰과 비용을 함께 보고한다. 다음 표는 다섯 행을 모두 옮겼다. 비용은 보고 당시의 문제당 평균 API 비용이며 현재 요금 견적이 아니다. 원문의 효율성 절은 비용을 달러·센트로 해석하는 계산을 사용한다.

구성과제 평균 정확도 (%)평균 토큰/문제평균 비용 (USD/문제)
MoA62.1311,2030.04855
Smoothie56.489,9090.03929
RouterDC52.418400.00561
MASRouter56.894,9700.01345
Conductor72.351,8200.02384

출처: Conductor 원문.

Conductor는 MoA와 Smoothie보다 정확도가 높고 비용이 낮다. RouterDC와 MASRouter보다 정확도는 높지만 비용도 높다. 특히 MASRouter의 비용은 0.01345달러로 Conductor의 0.02384달러보다 낮으므로 논문 본문의 “RouterDC를 제외한 기준보다 비용이 낮다”는 넓은 설명을 그대로 적용하기 어렵다. 호출 수, 토큰 수, 달러 비용은 같은 척도가 아니다. 이 글에서는 명시된 비용표에 맞춰 비교 범위를 좁힌다.

왜 토큰이 적은데 비용은 더 높을 수 있을까. 호출마다 사용하는 모델과 입력·출력 토큰의 가격이 다르면 토큰 합만으로 지출 순서를 정할 수 없기 때문이다. 이것은 가격 구조에서 따르는 일반적인 설명이며 원문 표만으로 MASRouter와 Conductor의 비용 차이를 호출별로 분해한 결과는 아니다. 제공사 요금, 재시도와 조정자 비용의 포함 범위를 확인하기 전에는 표를 서비스 전체 운영비로 바꾸기 어렵다.

작업 지시의 중요성도 별도 실험으로 확인한다. 원문 표 9에서 구체적인 하위 작업을 없애고 모두에게 같은 “사용자 질문을 풀라”는 지시를 준 변형의 LiveCodeBench는 58.62%, 기본 Conductor는 64.29%였다. 5.67%포인트 차이는 이 두 보고값을 뺀 계산이다. 모델과 전달 구조를 고르는 것만으로는 구체적인 지시가 하던 일을 모두 대신하지 못한다. 반면 세밀한 접근 목록 변형은 61.24%여서 더 복잡한 제어가 자동으로 이득이 되지도 않았다.

무엇을 학습한 효과인지 어디까지 분리됐나

이 연구에서 가장 납득할 만한 기여는 모델 이름을 고르는 일에 더해 하위 작업의 지시도 학습할 행동으로 만든 것이다. 같은 작업자 풀을 쓰는 제한된 평가와 지시를 제거한 변형이 그 판단을 뒷받침한다. 다만 표 9의 지시 제거는 학습된 시스템의 한 부분을 평가 때 바꾼 비교다. 구체적인 지시 없이 처음부터 다시 학습한 조정자보다 반드시 낫다고 증명하는 실험과는 다르다.

원문 그림 7에서 30억·70억 매개변수 조정자는 비슷한 작업자 선택 분포에 도달하지만 성능이 다르다. 이는 선택 비율만으로 성능을 설명하기 어렵다는 근거다. 그렇다고 차이 전부를 프롬프트의 품질로 확정할 수는 없다. 전체 선택 분포가 같아도 질문별 배정, 순서, 호출 수는 다를 수 있다. 그 원인을 더 분리하려면 같은 질문에서 작업자와 전달 구조를 고정하고 두 조정자의 지시만 교환하는 비교가 필요하다. 이 추가 비교는 원문의 결과가 아니라 리뷰자의 제안이다.

기본 Conductor가 처음부터 전체 흐름을 출력한다는 점도 중요하다. 뒤의 작업자는 앞의 결과를 보고 행동하지만 조정자 자체가 모든 중간 결과를 관찰하며 다음 단계를 다시 설계하는 것은 아니다. 오류가 발생한 위치에 맞춰 계획을 바꾸는 능력은 아래의 재귀 확장에서 추가된다. 자연어로 표현할 수 있는 흐름이 넓다는 사실과 실행 중 언제든 계획을 수정한다는 사실을 구분해야 한다.

재귀는 잘못된 계획을 다시 짜는 기회다

학습된 계획이 처음 보는 문제에 잘 맞지 않을 때 Conductor를 다시 작업자로 호출할 수 있다. 새 호출에는 기존 계획과 이전 작업자의 답을 제공한다. 조정자는 그 결과를 보고 새 흐름을 만들거나 기존 답을 반환한다. 무한히 반복하지 않도록 재귀 횟수 상한을 둔다.

가상 경로 문제의 조건을 바꿔 보자. “총비용이 최소”라는 조건에 “A를 지나면 안 된다”가 추가된다. 기존 계산의 비용 4는 이제 실행 불가능하다. 새 조건을 받은 조정자는 같은 계산을 더 오래 검토하기보다, A를 제외하고 다시 풀도록 작업을 바꿔야 한다. 그때 정답은 직접 경로 S→T의 비용 5다. 재귀의 가치는 이전 결론을 반복하는 횟수보다 계획의 가정을 다시 여는 가능성에 있다. 이 예제는 재귀 효과를 재현한 실험이 아니다.

원문의 제한된 평가에서 BigCodeBench 정확도는 기본 Conductor의 37.8%에서 재귀 구성의 40.0%로 오른다. AIME25는 두 구성 모두 66.67%, GPQA Diamond는 81.31%에서 82.32%다. 호출 수는 기존의 두 배 미만으로 제한했다. 추가 호출의 이득은 과제마다 다르며 재귀가 모든 실패를 해결하거나 같은 비용으로 개선한다는 결과가 아니다. Conductor 원문

새 모델을 작업자 풀에 넣을 때도 같은 경계가 남는다. 연구는 알려진 풀의 무작위 부분집합으로 추가 학습해 사용 가능한 모델이 줄어드는 경우에 적응한다. 이를 어떤 새 모델이 와도 곧바로 능력을 안다는 보장으로 볼 수는 없다. 또 접근 목록은 답변의 전달을 제어할 뿐, 도구 권한이나 파일 쓰기 충돌을 해결하는 보안 장치가 아니다.

여러 모델을 엮은 시스템이 단일 모델보다 못하다면 인원을 더하기 전에 마지막 작업자가 받은 지시와 근거를 확인할 수 있다. 무엇을 독립적으로 풀어야 했고 어느 결과를 이어받아야 했는지 최종 답을 누가 어떤 기준으로 선택했는지가 보이면 협업의 실패를 모델 이름 밖에서도 설명할 수 있다.

원문과 참고 자료

  • Stefan Nielsen, Edoardo Cetin, Peter Schwendeman, Qi Sun, Jinglue Xu, Yujin Tang, Learning to Orchestrate Agents in Natural Language with the Conductor, arXiv:2512.04388v5, 2026년 5월 6일 개정. 논문 · HTML · PDF