AI Observability for Large Language Model Systems — Twinkll Sisodia의 관측성 분류
AI Observability for Large Language Model Systems를 읽으며 확신도 보정, 행동 감시, 운영 평가, 추론 추적이 각각 무엇을 증명하는지 살펴본다.
Engineering notes
엔지니어링 노트
새로 쓴 글
응답 유실을 실제 HTTP로 재현하고, 같은 작업 ID의 재전송과 새 작업 생성이 만드는 차이, 상태 조회만으로 미실행을 단정할 수 없는 이유를 설명한다.
글 읽기The notebook
백엔드 개발과 시스템 설계에서 배운 것을 정리합니다.
AI Observability for Large Language Model Systems를 읽으며 확신도 보정, 행동 감시, 운영 평가, 추론 추적이 각각 무엇을 증명하는지 살펴본다.
AI 엔지니어링 자료 모음의 평가·메모리 설명을 비판적으로 읽는다. 답변과 실제 작업 결과를 구분하는 실행 예제로 자료를 설계 판단에 연결한다.
DPR의 단일 벡터와 ColBERT의 토큰별 MaxSim을 비교하고, Sourty 등의 2026년 다국어 검색 실험에서 학습에 없던 언어의 결과와 남은 비용·일반화 경계를 읽는다.
FlashAttention의 온라인 softmax가 HBM 왕복을 줄이는 원리부터 Blackwell용 FA4와 FP4 후속 연구의 속도·오차·학습 안정성 경계까지 세 논문으로 살펴본다.
선택 범위와 요청 세대를 분리해 늦은 성공·실패·로딩 해제, 화면 종료와 IME 타이머 경쟁을 재현한다.
GLIE의 구면 정규화, 작은 저장 코드, 후보 문서 복원을 수치 예제와 ViDoRe 결과로 읽는다. 저장량 절감과 재점수 정확도의 경계도 구분한다.
RAG에서 원본 버전과 검색에 공개한 색인 버전을 분리하고, 부분 색인과 전환 중 읽기가 만드는 오류를 실행 가능한 예제로 확인한다.
MapReduce의 장애 복구와 Incr의 수정 후 재실행을 비교하고, 명령을 생략하려면 입력뿐 아니라 파일·스트림 효과까지 확인해야 하는 이유를 작은 실행 추적으로 설명한다.