본문 바로가기

리디 접속이 원활하지 않습니다.
강제 새로 고침(Ctrl + F5)이나 브라우저 캐시 삭제를 진행해주세요.
계속해서 문제가 발생한다면 리디 접속 테스트를 통해 원인을 파악하고 대응 방법을 안내드리겠습니다.
테스트 페이지로 이동하기

AI Safety·Alignment·Interpretability — 모델 내부를 이해하기 상세페이지
미리보기
  • 컴퓨터/IT개발/프로그래밍

AI Safety·Alignment·Interpretability — 모델 내부를 이해하기

RLHF·Constitutional AI·SAE·Sleeper Agents·거버넌스

  • 관심 0
  • 정민제 저자
대여
권당 30일
4,000원
소장
전자책 정가
9,900원
판매가
9,900원
대여소장
출간 정보
  • 2026.07.19 전자책 출간
듣기 기능
TTS(듣기) 지원
파일 정보
  • EPUB
  • 약 10.8만 자
  • 0.5MB
지원 환경
  • 앱
  • 웹
  • PC뷰어
  • PAPER
ISBN
9791124458747
UCI
-
AI Safety·Alignment·Interpretability — 모델 내부를 이해하기

작품 정보

2022년 1월, InstructGPT 논문이 발표됐을 때 AI 정렬(alignment)이라는 단어는 학계의 변두리 용어였습니다. RLHF가 1.3B 모델로 GPT-3 175B의 응답 선호도를 앞지른 그 결과는, "정렬이 단순한 안전 장치가 아니라 모델의 핵심 능력"임을 보여 줬습니다. 4년이 지난 지금, 정렬·해석가능성·거버넌스는 frontier AI 개발의 세 기둥이 됐습니다.

이 책은 그 4년의 진화를 다섯 개의 장으로 풀어냅니다. 1장 RLHF부터 DPO까지의 정렬 방법론, 2장 Anthropic Constitutional AI의 헌법 기반 학습, 3장 Sparse Autoencoder와 Circuit Tracing이 만든 mechanistic interpretability 혁명, 4장 Red Teaming·Sleeper Agents·Alignment Faking이 드러낸 새로운 위험, 5장 Anthropic RSP·OpenAI Preparedness·EU AI Act·한국 AI 기본법의 거버넌스 양극화까지.

단순한 정책 리뷰가 아닙니다. arXiv 1차 논문 30여 편(InstructGPT·DPO·CAI·Sleeper Agents·Alignment Faking·Ganguli Red Teaming·Anthropic Scaling Monosemanticity·Circuit Tracing 등)과 Anthropic·OpenAI·METR·AISI 공식 정책 문서를 직접 인용하며, "RLHF는 정렬의 시작점, 끝이 아니다"·"모델 내부는 더 이상 완전한 블랙박스가 아니다"·"거버넌스 양극화 — 자율 규제와 법적 의무의 동시 진행" 같은 통일적 시각을 책 전체의 축으로 잡았습니다.

생성형 AI 시리즈 8권. 1~7권이 LLM·Reasoning·RAG·Agent·멀티모달·Diffusion·Prompt의 능력을 다뤘다면, 8권은 그 능력을 *어떻게 안전하게 만드는가*를 정리합니다. 9권 SLM·온디바이스 AI로 자연스럽게 이어집니다. AI 정책·거버넌스 담당자, 연구자, ML 안전성 엔지니어, 그리고 EU AI Act·한국 AI 기본법 시행에 대비해야 하는 기업 의사결정자에게 권합니다.

리뷰

0.0

구매자 별점
0명 평가

이 작품을 평가해 주세요!

건전한 리뷰 정착 및 양질의 리뷰를 위해 아래 해당하는 리뷰는 비공개 조치될 수 있음을 안내드립니다.
  1. 타인에게 불쾌감을 주는 욕설
  2. 비속어나 타인을 비방하는 내용
  3. 특정 종교, 민족, 계층을 비방하는 내용
  4. 해당 작품의 줄거리나 리디 서비스 이용과 관련이 없는 내용
  5. 의미를 알 수 없는 내용
  6. 광고 및 반복적인 글을 게시하여 서비스 품질을 떨어트리는 내용
  7. 저작권상 문제의 소지가 있는 내용
  8. 다른 리뷰에 대한 반박이나 논쟁을 유발하는 내용
* 결말을 예상할 수 있는 리뷰는 자제하여 주시기 바랍니다.
이 외에도 건전한 리뷰 문화 형성을 위한 운영 목적과 취지에 맞지 않는 내용은 담당자에 의해 리뷰가 비공개 처리가 될 수 있습니다.
아직 등록된 리뷰가 없습니다.
첫 번째 리뷰를 남겨주세요!
'구매자' 표시는 유료 작품 결제 후 다운로드하거나 리디셀렉트 작품을 다운로드 한 경우에만 표시됩니다.
무료 작품 (프로모션 등으로 무료로 전환된 작품 포함)
'구매자'로 표시되지 않습니다.
시리즈 내 무료 작품
'구매자'로 표시되지 않습니다. 하지만 같은 시리즈의 유료 작품을 결제한 뒤 리뷰를 수정하거나 재등록하면 '구매자'로 표시됩니다.
영구 삭제
작품을 영구 삭제해도 '구매자' 표시는 남아있습니다.
결제 취소
'구매자' 표시가 자동으로 사라집니다.

개발/프로그래밍 베스트더보기

개발/프로그래밍 베스트
  1. AI 에이전트 실행 세계 2_설계편
  2. AI 에이전트 실행 세계 1_원리편
  3. 직장인을 위한 AI 에이전트 클로드 코워크
  4. 하네스 엔지니어링 with 클로드 코드
  5. AI 에이전트 생태계
  6. 밑바닥부터 시작하는 딥러닝 6
  7. 개발자를 위한 레디스
  8. 신입 개발자를 위한 최소한의 CS 지식
  9. 핸즈온 머신러닝 with 사이킷런, 파이토치
  10. 말하는 대로 제미나이 × 3D 바이브 코딩

본문 끝 최상단으로 돌아가기

spinner
앱으로 연결해서 다운로드하시겠습니까?
닫기 버튼
대여한 작품은 다운로드 시점부터 대여가 시작됩니다.
앱으로 연결해서 보시겠습니까?
닫기 버튼
앱이 설치되어 있지 않으면 앱 다운로드로 자동 연결됩니다.