딥러닝 확률 면접은 공식을 길게 나열하기보다 “확률을 어떤 공간으로 바꾸고, 무엇을 최대화하며, 불확실성을 어떻게 재는가”를 한 문장씩 연결해 답하면 훨씬 선명해집니다.
원문은 Deep Learning Interviews 정리 저장소를 따라가며 질문을 메모한 글이었습니다. 다만 답이 비어 있거나 검증이 덜 된 항목도 많아, 여기서는 원문 안에서 설명이 갖춰진 개념만 골라 면접 답변 순서로 다시 구성합니다.
딥러닝 확률 면접은 공식을 길게 나열하기보다 “확률을 어떤 공간으로 바꾸고, 무엇을 최대화하며, 불확실성을 어떻게 재는가”를 한 문장씩 연결해 답하면 훨씬 선명해집니다.
원문은 Deep Learning Interviews 정리 저장소를 따라가며 질문을 메모한 글이었습니다. 다만 답이 비어 있거나 검증이 덜 된 항목도 많아, 여기서는 원문 안에서 설명이 갖춰진 개념만 골라 면접 답변 순서로 다시 구성합니다.
먼저 개념을 한 문장으로 정의하고, 입력과 출력이 어느 범위에 있는지 말합니다. 다음으로 수식의 분자, 분모나 합의 대상이 무엇인지 짚고, 마지막에 모델 학습에서 쓰이는 지점과 공식이 성립하지 않는 조건을 덧붙이면 됩니다. 이 네 단계를 지키면 수식만 읊거나 직관만 말하는 답변을 피할 수 있습니다.
예를 들어 logit을 묻는다면 “확률의 odds에 로그를 취한 값”이라고 정의한 뒤 p는 (0,1), logit은 실수 전체라는 범위를 밝힙니다. 이어 logistic regression의 선형 출력이 log-odds가 된다고 연결하고, p=0 또는 p=1에서는 유한한 logit을 얻지 못한다는 경계 조건을 말할 수 있습니다. 반대로 처음부터 sigmoid 미분식만 적으면 질문의 핵심인 확률 해석을 놓치기 쉽습니다.
확률 p는 0과 1 사이지만, 선형 모델의 출력은 실수 전체를 오갈 수 있습니다. Odds는 사건이 일어날 확률과 일어나지 않을 확률의 비율입니다.
여기에 로그를 취한 logit은 확률 구간을 실수 전체로 옮깁니다.
\[\operatorname{logit}(p)=\log\frac{p}{1-p}\]Logistic regression은 입력의 선형 결합을 log-odds로 보고, 그 역함수인 sigmoid로 다시 확률을 만듭니다. 따라서 “sigmoid를 왜 쓰나?”라는 질문에는 “무제한 실수 출력을 0과 1 사이의 Bernoulli 확률로 해석하기 위해서”라고 먼저 답할 수 있습니다.
Sigmoid를 y=σ(x)라고 두면 미분은 y(1-y)입니다. 이미 계산한 출력만으로 기울기를 구할 수 있다는 점이 구현에서도 편리합니다. 다만 큰 절댓값의 입력에서 지수 계산이 overflow하지 않도록 값을 제한하는 수치 안정성 처리가 필요합니다. 원문의 예시는 약 709를 경계로 잘라 계산합니다.
숫자로 확인하면 관계가 더 분명합니다. p=0.5이면 odds는 1이고 logit은 0입니다. p가 0.5보다 커지면 odds와 logit은 양수가 되고, 작아지면 logit은 음수가 됩니다. sigmoid는 이 변환을 거꾸로 적용하므로 선형 점수 0을 확률 0.5로, 큰 양수를 1에 가까운 값으로 바꿉니다. 다만 “1에 가깝다”와 “반드시 1이다”를 혼동하면 포화 영역의 작은 기울기와 수치 안정성 문제를 설명할 수 없습니다.
Likelihood는 관측된 정답이 현재 모델에서 나올 가능성을 뜻합니다. 학습은 정답 데이터의 likelihood를 크게 만드는 파라미터를 찾는 과정이며, 곱셈과 최적화를 다루기 쉽도록 로그를 취합니다. 최대화 문제를 일반적인 최소화 문제로 바꾸면 negative log-likelihood가 됩니다.
분류에서는 정답 클래스에 높은 확률을 줄수록 손실이 작아집니다. 이 답변의 핵심은 “모든 클래스 확률을 똑같이 올린다”가 아니라 “실제로 관측된 정답의 로그확률을 최대화한다”는 것입니다. Logistic regression이 generalized linear model인 이유도 함께 설명할 수 있습니다. 확률분포를 정하는 random component, 입력의 선형 결합인 systematic component, 평균과 선형 예측자를 잇는 link function으로 구성되며 Bernoulli 응답에는 logit link를 사용합니다.
과적합 질문이 이어지면 규제 강도를 높이거나 feature 수를 줄이고, 더 많은 학습 데이터를 확보하는 선택지를 말할 수 있습니다. 단순히 “복잡한 모델이라서”라고 끝내기보다 검증 성능으로 규제와 feature 선택을 결정한다고 연결하는 편이 좋습니다.
NLL 답변에서 흔한 빈틈은 likelihood를 파라미터의 확률이라고 부르는 것입니다. 관측 데이터를 고정했을 때 파라미터에 따라 데이터가 얼마나 그럴듯한지를 비교하는 함수라고 말해야 합니다. 또 로그를 취하는 이유를 단순히 “계산하기 편해서”라고만 답하기보다, 독립 표본의 확률 곱을 합으로 바꾸어 매우 작은 수의 연속 곱에서 생기는 수치 문제를 줄이고 미분을 단순하게 만든다고 설명하는 편이 정확합니다.
정답 클래스의 예측 확률이 0에 가까워지면 로그확률은 큰 음수가 되고 NLL은 크게 증가합니다. 그래서 잘못 확신한 예측을 강하게 벌하지만, 실제 구현에서는 정확히 0의 로그가 생기지 않도록 안정적인 결합 연산이나 제한이 필요합니다. 손실식을 이해했다면 최종 확률을 먼저 반올림하거나, sigmoid를 중복 적용한 뒤 같은 손실에 넣는 구현이 왜 문제가 되는지도 설명할 수 있어야 합니다.
조건부확률은 B가 일어났다는 정보 아래 A가 일어날 확률입니다.
\[P(A\mid B)=\frac{P(A\cap B)}{P(B)}\]분모인 P(B)가 0이면 이 식으로 조건부확률을 정의할 수 없습니다. 면접에서는 교집합을 전체 표본으로 나누는 실수를 피하고, “조건이 된 집단 B 안에서 A의 비율”이라고 풀어 말하면 됩니다.
Relative Risk는 두 집단의 사건 발생 확률을 비교하고, Odds Ratio는 두 집단의 odds를 비교합니다. 둘 다 신뢰구간에 1이 포함되면 차이가 뚜렷하다고 보기 어렵다는 해석을 덧붙일 수 있습니다. 사건이 흔할 때 odds와 probability를 같은 값처럼 말하면 안 된다는 점도 중요합니다.
작은 표를 머릿속에 그려 보는 방법도 좋습니다. 노출 집단과 비노출 집단을 행으로, 사건 발생과 미발생을 열로 둔 뒤 Relative Risk는 각 행의 발생 비율을 비교하고 Odds Ratio는 각 행 안의 발생 대 미발생 비율을 비교합니다. 사건이 드물 때 두 값이 비슷해 보일 수 있지만, 이것이 두 정의가 같다는 뜻은 아닙니다. 표본 선택 방식 때문에 실제 위험도를 직접 계산할 수 없는 상황에서는 odds ratio가 쓰일 수 있다는 정도까지 구분하면 답변이 단단해집니다.
Bernoulli random variable은 한 번의 성공과 실패를 나타냅니다. 성공 확률이 p라면 기댓값은 p, 분산은 p(1-p)입니다. 독립적인 Bernoulli 시행을 n번 더한 Binomial 변수는 성공 횟수를 세며, 기댓값과 분산은 다음과 같습니다.
Binomial distribution은 각 시행의 성공 확률이 같고 시행이 독립이라는 전제를 함께 확인해야 합니다. 전제가 깨지면 공식만 그대로 적용할 수 없습니다.
Shannon entropy는 분포의 불확실성을 재는 값입니다.
\[H(X)=-\sum_x p(x)\log_2 p(x)\]확률이 한 결과에 몰리면 불확실성이 작고, 가능한 결과에 고르게 퍼질수록 큽니다. 정보량 -\log_2 p(x)는 드문 사건일수록 큽니다. 면접에서는 entropy 공식을 말한 다음, “예측 분포가 얼마나 확신하는지”와 연결하면 의미가 살아납니다.
Bernoulli와 Binomial을 구분할 때는 반례가 유용합니다. 동전을 한 번 던져 앞면 여부를 기록하면 Bernoulli이고, 같은 동전을 열 번 독립적으로 던져 앞면 횟수를 기록하면 Binomial입니다. 그러나 매 시행마다 동전이 바뀌어 성공 확률이 달라지거나, 앞선 결과가 다음 결과에 영향을 준다면 동일한 p와 독립성이라는 Binomial 전제가 깨집니다. 단순히 결과가 0과 1로 표현된다는 이유만으로 여러 시행의 합을 Binomial이라고 부를 수는 없습니다.
Entropy 역시 분류 정확도와 같은 값이 아닙니다. 두 모델이 같은 클래스를 맞혔더라도 하나가 거의 균등한 확률을, 다른 하나가 정답에 집중된 확률을 내면 entropy는 달라집니다. 반대로 낮은 entropy가 항상 좋은 예측을 뜻하지도 않습니다. 틀린 클래스에 확률을 몰아 준 모델도 entropy는 낮기 때문에, 불확실성과 정답 일치 여부를 따로 봐야 합니다.
이 글은 방대한 면접 문제 전체의 정답지가 아닙니다. Bayesian inference, mutual information 등 원문에서 답이 완성되지 않은 질문은 일부러 제외했습니다. 실제 준비에서는 각 공식을 한 번 유도하고, 전제가 무엇인지와 반례 하나를 함께 설명해 보는 것이 단순 암기보다 안전합니다.
Odds는 p/(1-p)이고, logit은 그 odds에 로그를 취해 0과 1 사이 확률을 실수 전체로 옮긴 값입니다.
관측된 정답의 likelihood를 최대화하되, 확률의 곱을 로그의 합으로 바꾸고 부호를 뒤집어 최소화 문제로 푸는 것입니다.
Bernoulli는 한 번의 성공, 실패 시행이고, Binomial은 독립적이며 성공 확률이 같은 Bernoulli 시행을 여러 번 했을 때 성공 횟수의 분포입니다.
Odds는 p/(1-p)이고, logit은 그 odds에 로그를 취해 0과 1 사이 확률을 실수 전체로 옮긴 값입니다.
관측된 정답의 likelihood를 최대화하되, 확률의 곱을 로그의 합으로 바꾸고 부호를 뒤집어 최소화 문제로 푸는 것입니다.
Bernoulli는 한 번의 성공, 실패 시행이고, Binomial은 독립적이며 성공 확률이 같은 Bernoulli 시행을 여러 번 했을 때 성공 횟수의 분포입니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.