Architectural Design Decisions in AI Agent Harnesses — Hu Wei의 에이전트 설계 분석
70개 에이전트 시스템을 비교한 논문으로 위임·컨텍스트·도구·안전·오케스트레이션의 경계를 읽고, 그 근거가 말하지 못하는 것까지 짚는다.
Engineering notes
엔지니어링 노트
컴퓨터 과학의 고전과 최근 AI 연구를 원리, 실험 근거, 적용 한계로 읽는 글.
8편 · 최신순
70개 에이전트 시스템을 비교한 논문으로 위임·컨텍스트·도구·안전·오케스트레이션의 경계를 읽고, 그 근거가 말하지 못하는 것까지 짚는다.
AI Observability for Large Language Model Systems를 읽으며 확신도 보정, 행동 감시, 운영 평가, 추론 추적이 각각 무엇을 증명하는지 살펴본다.
AI 엔지니어링 자료 모음의 평가·메모리 설명을 비판적으로 읽는다. 답변과 실제 작업 결과를 구분하는 실행 예제로 자료를 설계 판단에 연결한다.
DPR의 단일 벡터와 ColBERT의 토큰별 MaxSim을 비교하고, Sourty 등의 2026년 다국어 검색 실험에서 학습에 없던 언어의 결과와 남은 비용·일반화 경계를 읽는다.
FlashAttention의 온라인 softmax가 HBM 왕복을 줄이는 원리부터 Blackwell용 FA4와 FP4 후속 연구의 속도·오차·학습 안정성 경계까지 세 논문으로 살펴본다.
GLIE의 구면 정규화, 작은 저장 코드, 후보 문서 복원을 수치 예제와 ViDoRe 결과로 읽는다. 저장량 절감과 재점수 정확도의 경계도 구분한다.
MapReduce의 장애 복구와 Incr의 수정 후 재실행을 비교하고, 명령을 생략하려면 입력뿐 아니라 파일·스트림 효과까지 확인해야 하는 이유를 작은 실행 추적으로 설명한다.
1972년 Parnas 논문의 KWIC 예제를 따라가며 처리 단계와 책임 경계의 차이를 살펴본다. 두 저장 표현을 교체하는 실행 예제로 정보 은닉의 효과와 한계를 확인한다.