학습(공부)하는 블로그 :: 학습(공부)하는 블로그
 

 
반응형
블로그 이미지
학습하고 공부한 것을 보고 싶을때 다시 볼려고 요약해서 정리한 블로그입니다. 좋은 정보는 서로 공유합시다. 깨비형
« 2026/10 »
일 월 화 수 목 금 토
1 2 3
4 5 6 7 8 9 10
11 12 13 14 15 16 17
18 19 20 21 22 23 24
25 26 27 28 29 30 31

Archive»


Category»

Notice»

Recent Post»

Recent Comment»

Recent Trackback»

10-09 00:10

반응형

 

어두운 격자 위에서 아래쪽 점들과 위쪽 점들 사이를 빛나는 주황색 S자 곡선이 이어 주는 로지스틱 회귀 이미지
출처: 생성형AI가 만든 이미지 — 0과 1 사이를 잇는 S자 시그모이드 곡선

💡 1분 핵심 요약 (TL;DR)

  • ✅ 로지스틱 회귀 — 합격/불합격처럼 참(1)과 거짓(0) 중 하나를 고르는 문제에서, 직선 대신 S자 곡선을 긋는 방법
  • ✅ 시그모이드 함수 — y = 1 / (1 + e−(ax+b)). a는 S자의 경사도, b는 좌우 이동을 정함
  • ✅ 교차 엔트로피 오차 — 실제 값이 1이면 −log h, 0이면 −log(1−h). 합치면 −{y log h + (1−y) log(1−h)}
  • ✅ 케라스 실습 — Dense(1, activation='sigmoid') + loss='binary_crossentropy'. 7시간 공부 → 합격 확률 약 60%
  • ✅ 퍼셉트론 — 입력에 가중치를 곱해 더한 값(가중합)이 기준을 넘으면 1, 아니면 0을 내는 최초의 학습하는 인공 신경망(1957)
  • ✅ XOR 문제 — 직선 하나로는 XOR의 0과 1을 나눌 수 없음 → 퍼셉트론의 한계. 다층 퍼셉트론과 오차 역전파로 해결(7주차)

📚 부산디지털대학교 '파이썬 기반의 AI프로그래밍' 6주차 강의노트를 바탕으로 정리한 학습 노트입니다. (출처는 글 하단 참고)

 

 

 

 

01 로지스틱 회귀란?

1강 · 참과 거짓 중 하나를 고르는 미니 판단 장치

 

딥러닝 내부에서는 전달받은 정보를 놓고 참과 거짓 중 하나를 판단해 다음 단계로 넘기는 장치들이 쉬지 않고 작동합니다. 딥러닝은 겉으로 드러나지 않는 이런 미니 판단 장치들을 이용해 복잡한 연산을 해낸 끝에 최적의 예측 값을 내놓는 작업입니다. 이 판단 장치의 원리가 바로 로지스틱 회귀(logistic regression)입니다.

 

 

직선으로는 안 되는 데이터

 

3~5주차에서는 공부한 시간과 성적(점수) 사이의 관계를 직선으로 표현했습니다(선형 회귀). 그런데 점수가 아니라 합격과 불합격만 발표되는 시험이라면 어떨까요?

 

공부한 시간 2 4 6 8 10 12 14
합격 여부 불합격 불합격 불합격 합격 합격 합격 합격
좌표 값 0 0 0 1 1 1 1

 

합격을 1, 불합격을 0으로 놓고 좌표에 찍으면 점들이 0과 1 두 줄에만 모여 있습니다. 이 점들의 특성을 일차 방정식(직선) 하나로 잘 나타낼 수 있을까요?

 

❌ 직선 y = ax + b

· 1과 0 사이의 값이 없으므로 직선으로 표현하기 어려움
· 직선은 끝없이 올라가거나 내려가 0보다 작거나 1보다 큰 값도 나옴
  ✅ S자 곡선

· 0 근처에 머물다가 어느 지점에서 1로 올라감
· 점들의 특성을 정확하게 표현 가능
· 값이 항상 0~1 사이 → 확률처럼 읽을 수 있음

 

📖 로지스틱 회귀 (logistic regression)
직선이 아니라, 참(1)과 거짓(0) 사이를 구분하는 S자 형태의 선을 그어 주는 작업

 

공부 시간 카드를 넣으면 합격 또는 불합격 램프를 켜는 작은 판단 기계와 학생을 그린 그림
출처: 생성형AI가 만든 이미지 — 참과 거짓 중 하나를 고르는 로지스틱 회귀의 판단 장치

 

❌ 시험 함정 — 로지스틱 회귀가 쓰이는 문제
로지스틱 회귀는 여러 문제를 예측하는 상황 중에서도 Yes 또는 No처럼 좁은 범위의 선택을 해야 할 때 적용합니다. 참과 거짓 중 하나를 내놓는 과정이며, S자 형태의 시그모이드 함수를 바탕으로 한 오차 공식과 경사 하강법을 이용합니다. 점수처럼 연속적인 값을 예측하는 것은 선형 회귀의 몫입니다.

 

 

 

 

02 시그모이드 함수

S자 곡선을 만드는 식, a는 경사도 · b는 좌우 이동

 

S자 형태로 그래프가 그려지는 함수를 시그모이드 함수(sigmoid function)라고 합니다. 1주차 수학에서 미리 만나 본 함수이고, 2주차에서는 출력층의 활성화 함수로도 등장했습니다. 관련 식은 다음과 같습니다.

 

y = 1 / (1 + e−(ax+b))
아래 코드도 이 식으로 계산

 

값 그래프에서 하는 일 바뀌면?
a 그래프의 경사도 a가 커지면 경사가 커지고(가파른 S), a가 작아지면 경사가 작아짐(완만한 S)
b 그래프의 좌우 이동 b가 크고 작아짐에 따라 그래프가 왼쪽·오른쪽으로 이동

 

직접 계산해 보면 a와 b의 역할이 숫자로 보입니다. 공부 시간 2~14시간에 대해 세 가지 a, b 조합으로 시그모이드 값을 구했습니다.

 

a와 b를 바꿔 가며 시그모이드 값 구하기

import numpy as np

def sigmoid(z):
    return 1 / (1 + np.exp(-z))   # 시그모이드 함수 식

x = np.array([2, 4, 6, 8, 10, 12, 14])
for a, b in [(1, -7), (3, -21), (1, -9)]:
    print(f"a={a}, b={b} →", np.round(sigmoid(a * x + b), 3))

 

▶ 실행 결과 (x = 2 ~ 14)

a=1, b=-7 → [0.007 0.047 0.269 0.731 0.953 0.993 0.999]
a=3, b=-21 → [0.    0.    0.047 0.953 1.    1.    1.   ]
a=1, b=-9 → [0.001 0.007 0.047 0.269 0.731 0.953 0.993]

 

a를 1에서 3으로 키우자 0.047에서 0.953으로 한 번에 확 뛰는 가파른 S자가 되었고, b를 −7에서 −9로 바꾸자 같은 값들이 한 칸(2시간)씩 오른쪽으로 밀렸습니다. 그래프로 그리면 더 분명합니다.

 

a와 b의 역할을 그래프로 비교하기

import matplotlib.pyplot as plt

xs = np.linspace(0, 14, 200)    # 0~14를 200개로 잘게 나눔
fig, (ax1, ax2) = plt.subplots(1, 2, figsize=(10, 4))
for a, b in [(0.5, -3.5), (1, -7), (3, -21)]:      # 가운데(x=7)는 그대로, a만 바꾸기
    ax1.plot(xs, sigmoid(a * xs + b), label=f"a={a}, b={b}")
for a, b in [(1, -5), (1, -7), (1, -9)]:            # a는 그대로, b만 바꾸기
    ax2.plot(xs, sigmoid(a * xs + b), label=f"a={a}, b={b}")
ax1.set_title("a : slope"); ax2.set_title("b : shift")
ax1.legend(); ax2.legend()
plt.show()

 

▶ 실행 결과 (그래프 출력)

(왼쪽은 a가 클수록 가파른 S자 3개, 오른쪽은 b에 따라 좌우로 밀린 S자 3개가 나타남 — 아래 그림 1)

 

a가 클수록 가팔라지고 b에 따라 좌우로 밀리는 시그모이드 곡선 비교 그래프
그림 1 · a와 b에 따른 시그모이드 곡선 변화 (보충 실습 코드 실행 결과)

 

📖 심화 — b만 바꿨는데 왜 좌우로 움직일까?
시그모이드 값이 딱 0.5가 되는 곳은 ax + b = 0, 즉 x = −b / a인 지점입니다. a = 1일 때 b = −5이면 x = 5, b = −7이면 x = 7, b = −9이면 x = 9에서 0.5가 됩니다. 그래서 b가 클수록(−5) S자가 왼쪽, 작을수록(−9) 오른쪽으로 갑니다. 강의노트 그래프에서 b 값이 클 때의 곡선이 가장 왼쪽에 있는 것과 같은 결과입니다. 이 0.5 지점이 합격과 불합격을 가르는 경계가 됩니다.

 

 

a · b와 오차의 관계

 

선형 회귀에서 기울기와 오차가 포물선 관계였던 것처럼(4주차), 시그모이드의 a와 b도 오차와 관계가 있습니다. 강의노트 그래프를 정리하면 다음과 같습니다.

 

a와 오차

· a가 작을 때(0에 가까워질 때) → S자가 거의 평평해져 오차가 매우 큼
· a가 커질수록 → 0과 1을 또렷이 나눠 오차가 점점 줄어듦
· 그래프 모양 : 오른쪽으로 갈수록 낮아지는 곡선
  b와 오차

· b가 너무 작거나 너무 크면 → S자가 엉뚱한 곳으로 밀려 오차가 큼
· 적당한 b에서 오차가 가장 작음
· 그래프 모양 : 이차 함수(포물선)

 

 

 

 

03 오차 공식 — 교차 엔트로피

실제 값이 1이냐 0이냐에 따라 다른 로그 그래프를 쓴다

 

로지스틱 회귀도 선형 회귀처럼 경사 하강법으로 a와 b를 찾습니다. 다만 오차를 재는 방법이 다릅니다.

 

📖 로지스틱 회귀의 경사 하강법 (강의노트 정리)
① 오차를 구한 뒤 오차가 작은 쪽으로 이동시키는 방법 (선형 회귀와 같음)
② 참과 거짓을 판단하기 위해서는 평균 제곱 오차를 사용할 수 없음
③ 시그모이드 함수를 활용

 

시그모이드의 예측 값 h는 항상 0과 1 사이입니다. 실제 값도 0 아니면 1이므로, 실제 값이 1일 때와 0일 때를 나눠서 오차를 생각합니다. 이때 쓰는 것이 

로그

함수입니다.

 

선 언제 쓰나 식 오차가 0인 곳 → 커지는 곳
파란 선 실제 값이 1일 때 −log h 예측 값 1에서 오차 0 → 예측 값이 0에 가까울수록 큰 오차
빨간 선 실제 값이 0일 때 −log(1 − h) 예측 값 0에서 오차 없음 → 1에 가까워질수록 오차가 매우 커짐

 

두 식을 실제 값 y 하나로 합치면 다음 공식이 됩니다.

 

−{ y log h + (1 − y) log(1 − h) }
A 부분 = y log h  |  B 부분 = (1 − y) log(1 − h)  |  h : 예측 값(시그모이드 출력)

 

실제 값 y 사라지는 부분 남는 식 사용하는 그래프
1 B 부분 (1 − y = 0) −log h 파란 선
0 A 부분 (y = 0) −log(1 − h) 빨간 선

 

이렇게 실제 값에 따라 빨간 선과 파란 선을 골라 쓰는 공식으로, 평균 제곱 오차를 대신할 손실 함수를 계산할 수 있습니다. 이것이 교차 엔트로피 오차(cross entropy error) 함수이고, 케라스에서는 binary_crossentropy(이진 교차 엔트로피)라는 이름으로 씁니다.

 

교차 엔트로피와 제곱 오차 비교하기

def cross_entropy(y, h):
    return -(y * np.log(h) + (1 - y) * np.log(1 - h))

for y, h in [(1, 0.99), (1, 0.5), (1, 0.01), (0, 0.01), (0, 0.99)]:
    print(f"실제 y={y}, 예측 h={h:<4} → 교차 엔트로피 {cross_entropy(y, h):.3f} / 제곱 오차 {(y - h) ** 2:.3f}")

 

▶ 실행 결과 (예측 값 5가지)

실제 y=1, 예측 h=0.99 → 교차 엔트로피 0.010 / 제곱 오차 0.000
실제 y=1, 예측 h=0.5  → 교차 엔트로피 0.693 / 제곱 오차 0.250
실제 y=1, 예측 h=0.01 → 교차 엔트로피 4.605 / 제곱 오차 0.980
실제 y=0, 예측 h=0.01 → 교차 엔트로피 0.010 / 제곱 오차 0.000
실제 y=0, 예측 h=0.99 → 교차 엔트로피 4.605 / 제곱 오차 0.980

 

📖 심화 — 완전히 틀렸을 때 벌점이 다르다
실제로는 합격(1)인데 0.01이라고 거의 확실하게 틀린 경우, 제곱 오차는 0.980으로 1을 넘지 못합니다. 교차 엔트로피는 4.605로 훨씬 큽니다. 확신을 갖고 틀릴수록 오차가 급격히 커지므로, 경사 하강법이 크게 틀린 예측을 더 강하게 바로잡게 됩니다. 반대로 거의 맞힌 경우(0.99)에는 두 방법 모두 오차가 0에 가깝습니다.

 

파란 선과 빨간 선 그리기

h = np.linspace(0.01, 0.99, 100)
plt.plot(h, -np.log(h), 'b', label='y = 1 : -log h')
plt.plot(h, -np.log(1 - h), 'r', label='y = 0 : -log(1-h)')
plt.xlabel('h (prediction)'); plt.ylabel('loss')
plt.legend()
plt.show()

 

▶ 실행 결과 (그래프 출력)

(예측 값 h에 따라 왼쪽 위로 치솟는 파란 선과 오른쪽 위로 치솟는 빨간 선이 나타남 — 아래 그림 2)

 

예측 값에 따라 치솟는 파란 선 −log h와 빨간 선 −log(1−h) 그래프
그림 2 · 교차 엔트로피의 두 로그 그래프 (보충 실습 코드 실행 결과)

 

 

 

 

04 로지스틱 회귀 실습

2강 · 케라스로 합격 확률 예측하기

 

1강의 합격/불합격 데이터를 케라스로 학습시켜 봅니다. 아래는 강의노트 실습 코드 그대로입니다(주석만 조금 정리).

 

로지스틱 회귀 실습 코드 (강의노트)

#분류 문제를 해결하기 위해 사용되는 통계적 모델
import numpy as np
import matplotlib.pyplot as plt
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Dense

x = np.array([2, 4, 6, 8, 10, 12, 14])   #공부 시간
y = np.array([0, 0, 0, 1, 1, 1, 1])      #합격 여부 (0: 불합격, 1: 합격)

model = Sequential()
model.add(Dense(1, input_dim=1, activation='sigmoid'))
model.compile(optimizer='sgd' ,loss='binary_crossentropy')
model.fit(x, y, epochs=5000)

plt.scatter(x, y)
plt.plot(x, model.predict(x),'r')
plt.show()

hour = 7
prediction = model.predict([hour])
print("%.f시간을 공부할 경우, 합격 예상 확률은 %.01f%%입니다" % (hour, prediction * 100))

 

▶ 실행 결과 (TensorFlow 2.21 · Keras 3.15 / 중간 4,990줄 생략)

.../keras/src/layers/core/dense.py:107: UserWarning: Do not pass an `input_shape`/`input_dim` argument to a layer. When using Sequential models, prefer using an `Input(shape)` object as the first layer in the model instead.
Epoch 1/5000
1/1 ━━━━━━━━━━━━━━━━━━━━ 1s 1s/step - loss: 2.7116
Epoch 2/5000
1/1 ━━━━━━━━━━━━━━━━━━━━ 0s 27ms/step - loss: 2.6809
...
Epoch 4999/5000
1/1 ━━━━━━━━━━━━━━━━━━━━ 0s 28ms/step - loss: 0.1858
Epoch 5000/5000
1/1 ━━━━━━━━━━━━━━━━━━━━ 0s 73ms/step - loss: 0.1858
1/1 ━━━━━━━━━━━━━━━━━━━━ 0s 46ms/step
(점 7개와 빨간 예측 곡선이 나타남 — 아래 그림 3)
ValueError: Unrecognized data type: x=[7] (of type <class 'list'>)

 

공부 시간별 합격 여부 점 7개와 케라스로 학습한 빨간 합격 확률 곡선
그림 3 · 로지스틱 회귀로 학습한 합격 확률 곡선 (강의노트 실습 코드 실행 결과)

 

loss(교차 엔트로피 오차)가 2.71에서 0.19까지 내려갔고, 빨간 선은 6시간에 약 44%, 8시간에 약 73%로 불합격(0)에서 합격(1) 쪽으로 올라가는 S자를 그립니다. 그런데 마지막 줄에서 오류가 났습니다.

 

❌ 강의노트 코드를 그대로 쓸 때 주의 — model.predict([hour])
최신 케라스(Keras 3)는 파이썬 리스트 [7]을 입력으로 받지 않아 ValueError: Unrecognized data type 오류가 납니다. 모델은 (데이터 개수, 특성 개수) 모양의 2차원 배열을 기대하므로 np.array([[hour]])처럼 넘겨야 합니다.
또 predict()는 숫자 하나가 아니라 [[0.59…]] 모양의 2차원 배열을 돌려줍니다. 이 배열을 그대로 %.01f에 넣으면 NumPy 버전에 따라 DeprecationWarning 경고(5주차에서 본 경고)가 나거나, 제 실행 환경(NumPy 2.5)처럼 TypeError: only 0-dimensional arrays can be converted to Python scalars 오류가 납니다. prediction[0][0]으로 숫자 하나를 꺼내 쓰면 두 문제가 모두 사라집니다.

 

✅ 마지막 두 줄 고치기

prediction = model.predict(np.array([[hour]]))   # 2차원 배열로 넣기
print("%.f시간을 공부할 경우, 합격 예상 확률은 %.01f%%입니다" % (hour, prediction[0][0] * 100))   # 숫자 하나 꺼내기

 

▶ 실행 결과 (위 모델에 이어서 실행 · 진행 표시줄 생략)

7시간을 공부할 경우, 합격 예상 확률은 59.6%입니다

 

코드 뜻 1강 개념과 연결
Dense(1, input_dim=1, activation='sigmoid') 입력 1개(공부 시간), 출력 뉴런 1개인 완전 연결층, 출력에 시그모이드 적용 y = 1 / (1 + e−(ax+b))
가중치 = a, 편향 = b
loss='binary_crossentropy' 이진 교차 엔트로피로 오차 측정 03의 −{y log h + (1−y) log(1−h)}
optimizer='sgd' 확률적 경사 하강법 (기본 학습률 0.01) 오차가 작아지는 쪽으로 a, b 이동
epochs=5000 데이터 전체로 5,000번 학습 경사 하강 반복
model.predict(x) 각 공부 시간의 합격 확률(0~1) 시그모이드 출력 h

 

❌ 시험 함정 — 로지스틱 회귀 코드의 빈칸
로지스틱 회귀는 참과 거짓을 내놓는 과정이므로 Dense() 안의 activation은 'sigmoid'로 설정합니다. 그리고 compile() 안의 loss는 'binary_crossentropy'로 설정합니다. 선형 회귀(5주차)의 loss='mse'와 짝을 지어 기억하세요.

 

✓ 그래프가 매끈한 S자가 아니라 꺾은선처럼 보이는 이유
plt.plot(x, model.predict(x))는 x에 있는 7개 점의 예측값만 직선으로 이었기 때문입니다. np.linspace(2, 14, 100)처럼 촘촘한 x로 predict하면 매끈한 S자가 나옵니다. 또 강의노트 그림보다 완만한 이유는 5,000번 학습 후에도 loss가 계속 줄어드는 중이기 때문입니다. 02에서 본 것처럼 학습이 더 진행되면 a(가중치)가 커지면서 S자가 점점 가팔라집니다. 처음 가중치를 무작위로 정하므로 실행할 때마다 loss와 확률의 끝자리도 조금씩 다릅니다.
덧붙여 model.predict(x, verbose=0)처럼 verbose=0을 주면 예측할 때마다 찍히는 1/1 ━━━━ 진행 표시줄이 나오지 않아 출력이 깔끔해집니다(아래 보충 코드에서 사용).

 

 

경고 없이 · 결과가 매번 같게 다시 써 보기

 

5주차처럼 Input을 맨 앞에 두면 UserWarning이 사라집니다. 시작값(시드)을 고정해 결과를 재현하고, 학습된 가중치와 편향을 꺼내 02의 x = −b / a 경계도 확인해 봅니다.

 

로지스틱 회귀 — 보충 코드

import numpy as np
import tensorflow as tf
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Input, Dense

tf.keras.utils.set_random_seed(1)   # 실행할 때마다 같은 결과가 나오도록 고정

x = np.array([2, 4, 6, 8, 10, 12, 14])
y = np.array([0, 0, 0, 1, 1, 1, 1])

model = Sequential()
model.add(Input(shape=(1,)))                 # 입력층 : 특성 1개(공부 시간)
model.add(Dense(1, activation='sigmoid'))    # 출력층 : 시그모이드 → 0~1 확률
model.compile(optimizer='sgd', loss='binary_crossentropy')
history = model.fit(x, y, epochs=5000, verbose=0)   # 학습 로그 생략

w, b = model.get_weights()
print("마지막 loss :", round(history.history['loss'][-1], 4))
print("가중치 w(a) :", round(float(w[0][0]), 4), " 편향 b :", round(float(b[0]), 4))
print("확률 50% 지점 x = -b/w :", round(float(-b[0] / w[0][0]), 2), "시간")

for hour in [5, 7, 9]:
    p = model.predict(np.array([[hour]]), verbose=0)[0][0]   # 2차원으로 넣고 숫자 하나 꺼내기
    print(f"{hour}시간 공부 → 합격 확률 {p * 100:.1f}%")

 

▶ 실행 결과 (TensorFlow 2.21 / CPU · 시드 1)

마지막 loss : 0.1893
가중치 w(a) : 0.6116  편향 b : -3.8869
확률 50% 지점 x = -b/w : 6.36 시간
5시간 공부 → 합격 확률 30.4%
7시간 공부 → 합격 확률 59.7%
9시간 공부 → 합격 확률 83.4%

 

학습된 가중치 0.6116이 시그모이드의 a, 편향 −3.8869가 b입니다. −b / a = 6.36이므로 이 모델은 약 6.4시간을 합격·불합격의 경계(확률 50%)로 판단했습니다. 데이터에서 불합격(6시간)과 합격(8시간) 사이에 경계가 생긴 것입니다.

 

 

 

 

05 선형 회귀 vs 로지스틱 회귀

무엇을 예측하느냐에 따라 함수와 오차 공식이 바뀐다

 

구분 선형 회귀 (3~5주차) 로지스틱 회귀 (6주차)
예측하는 것 연속적인 값 (점수 81, 93 …) 참(1) 또는 거짓(0) (합격/불합격)
그래프 직선 y = ax + b S자 곡선 y = 1 / (1 + e−(ax+b))
출력 범위 제한 없음 0 ~ 1 (확률처럼 읽음)
a와 b a : 기울기 / b : y절편 a : 경사도 / b : 좌우 이동
오차 공식 평균 제곱 오차(MSE) 교차 엔트로피 오차
a, b 찾는 방법 경사 하강법 경사 하강법
케라스 설정 activation 기본값(선형) · loss='mse' activation='sigmoid' · loss='binary_crossentropy'

 

왼쪽은 흩어진 점을 지나는 직선의 선형 회귀, 오른쪽은 0과 1에 모인 점을 잇는 S자 곡선의 로지스틱 회귀 비교 그림
출처: 생성형AI가 만든 이미지 — 직선으로 예측하는 선형 회귀와 S자로 판단하는 로지스틱 회귀

 

✓ 2주차와 연결하기
2주차에서 출력층은 문제 종류에 따라 달라진다고 배웠습니다.

 

이진 분류는 시그모이드 뉴런 1개, 회귀는 선형 함수를 씁니다. 오늘 만든 로지스틱 회귀 모델이 바로 시그모이드 뉴런 1개짜리 이진 분류 신경망입니다.

 

 

 

 

06 퍼셉트론

3강 · 뇌의 뉴런을 흉내 낸 최초의 학습하는 신경망

 

 

인공지능의 시작 — 뉴런

 

인간의 뇌는 치밀하게 연결된 뉴런 약 1,000억 개로 이루어져 있습니다(강의노트 기준). 뉴런은 서로 긴밀히 연결되어 신경 말단부터 뇌까지 곳곳에서 자신의 역할을 수행하고, 이 복잡하고 어려운 조합의 결과가 바로 생각입니다.

 

📖 보충 — 뉴런 수는 약 860억 개
오랫동안 널리 인용된 1,000억 개는 다른 측정값에서 어림한 숫자로, 이를 직접 뒷받침하는 논문이 없었습니다. 2009년 아제베두(Azevedo) 연구팀이 성인 남성의 뇌를 실제로 세어 보니 평균 약 861억 개(±81억)였습니다. 현재는 약 860억 개가 더 정확한 값으로 쓰입니다. 시험은 강의노트 기준(약 1,000억 개)으로 답하세요. (근거: MIT CBMM, How many neurons are there in human brain?, 2023)

 

① 자극
뉴런이
자극을 받음
→ ② 시냅스
화학 물질이
나옴
→ ③ 전위 변화
전기적 상태가
바뀜
→ ④ 판단
임계 값을 넘으면
다음 뉴런에 전달

 

왼쪽에 신호를 전달하는 생물 뉴런, 오른쪽에 입력과 가중치를 더해 계단 함수로 0이나 1을 내는 퍼셉트론을 나란히 그린 그림
출처: 생성형AI가 만든 이미지 — 뇌의 뉴런을 흉내 낸 퍼셉트론의 구조

 

임계 값을 넘지 못하면 신호가 전달되지 않습니다. 입력값을 놓고 활성화 함수에 의해 일정한 수준을 넘으면 참, 그렇지 않으면 거짓을 내보내는 로지스틱 회귀와 꼭 닮았습니다. 그래서 과학자들은 생각했습니다. 뉴런과 비슷한 메커니즘을 쓰면 인공적으로 생각하는 무언가를 만들 수 있지 않을까?

 

 

인공 신경망의 탄생

 

1943년
맥컬럭-월터 피츠
신경을 그물망으로 연결하면
뇌처럼 동작할 수 있다
→ 1957년
프랑크 로젠블랫
실제 장치로 구현
→ 퍼셉트론
→ 3년 후
아달라인
경사 하강법 도입
최적의 경계선
→ 이후
SVM 등 머신러닝
알고리즘으로 발전
+ 시그모이드 → 로지스틱 회귀

 

1943년 신경망 아이디어, 1957년 퍼셉트론, 1960년 아달라인, 1969년 XOR 한계 지적까지 이어지는 인공 신경망 역사 타임라인
출처: 생성형AI가 만든 이미지 — 1943년부터 1969년까지 인공 신경망의 초기 역사

 

📖 보충 — 맥컬럭-월터 피츠는 두 사람
강의노트의 맥컬럭-월터 피츠(McCulloch-Walter Pitts)는 한 사람의 이름이 아니라 워런 매컬럭(Warren McCulloch)과 월터 피츠(Walter Pitts) 두 사람입니다. 두 사람이 1943년에 함께 쓴 논문 A Logical Calculus of the Ideas Immanent in Nervous Activity가 켜고 끄는 신경을 그물망으로 연결하는 인공 신경망 아이디어의 출발점입니다. (근거: Wikipedia, A Logical Calculus of the Ideas Immanent in Nervous Activity)

 

인공 신경망(artificial neural network)은 1943년의 아이디어를 바탕으로, 1957년 프랑크 로젠블랫(Frank Rosenblatt)이 실제 장치로 만든 퍼셉트론(perceptron)에서 본격적으로 시작됩니다. 퍼셉트론은 여러 개의 입력 값을 받아 출력을 만들고, 입력 값의 가중치를 조절할 수 있게 만들어 최초로 학습을 수행했습니다. 3년 후에는 경사 하강법을 도입해 최적의 경계선을 그릴 수 있게 한 아달라인(Adaline)이 개발되었고, 이 흐름은 

서포트 벡터 머신

(Support Vector Machine) 같은 머신러닝의 중요한 알고리즘으로 발전했습니다. 시그모이드를 활성화 함수로 사용한 것이 바로 오늘 배운 로지스틱 회귀입니다.

 

 

퍼셉트론의 구조

 

📖 퍼셉트론 (perceptron)
입력 데이터를 받아 처리하고 결과를 출력하는 단순한 알고리즘. 이진 분류 문제를 해결하는 데 사용

 

구성 요소 하는 일
입력층(Input Layer) 여러 개의 입력 노드로 구성. 각 입력은 하나의 특성(feature)을 표현
가중치(Weights) 각 입력 노드에 연결된 값. 입력 신호의 중요도를 표현
편향(Bias) 가중치와 함께 더해지는 추가적인 상수 값. 모델의 유연성 조절
활성화 함수(Activation Function) 입력의 선형 조합을 비선형적으로 변환하는 함수. 퍼셉트론에서는 주로 계단 함수(step function) 사용

 

📖 가중합 (weighted sum)
입력 값과 가중치를 모두 곱한 후 바이어스(편향)를 더한 값 → w1x1 + w2x2 + b

 

계단 함수는 가중합이 0보다 크면 1, 아니면 0을 내는 함수입니다. 시그모이드가 0~1 사이를 부드럽게 오가는 S자라면, 계단 함수는 0에서 1로 뚝 끊어 올라가는 계단 모양입니다. 가중치를 직접 정해서 퍼셉트론 하나로 AND와 OR 판단을 해 보겠습니다.

 

계단 함수 퍼셉트론으로 AND · OR 판단하기

def step(z):
    return 1 if z > 0 else 0       # 계단 함수 : 0보다 크면 1, 아니면 0

def perceptron(x1, x2, w1, w2, b):
    z = w1 * x1 + w2 * x2 + b      # 가중합
    return step(z)

for x1, x2 in [(0, 0), (0, 1), (1, 0), (1, 1)]:
    print(f"x1={x1}, x2={x2} → AND {perceptron(x1, x2, 0.5, 0.5, -0.7)}, OR {perceptron(x1, x2, 0.5, 0.5, -0.2)}")

 

▶ 실행 결과 (w1 = w2 = 0.5, AND는 b = −0.7 · OR는 b = −0.2)

x1=0, x2=0 → AND 0, OR 0
x1=0, x2=1 → AND 0, OR 1
x1=1, x2=0 → AND 0, OR 1
x1=1, x2=1 → AND 1, OR 1

 

가중치는 같고 편향만 바꿨을 뿐인데 AND와 OR가 모두 만들어졌습니다. 둘 다 1이어야 가중합 0.5 + 0.5 − 0.7 = 0.3이 0을 넘으면 AND, 하나만 1이어도 0.5 − 0.2 = 0.3이 0을 넘으면 OR입니다.

 

 

퍼셉트론 · 아달라인 · 로지스틱 회귀 비교

 

구분 퍼셉트론 아달라인 로지스틱 회귀
계산 흐름
(강의노트 그림)
가중합 → 참? 거짓? 가중합 → 경사 하강법 → 참? 거짓? 가중합 → 경사 하강법 → 시그모이드 → 참? 거짓?
경계선 조건을 만족하는 선이 여러 개 존재 경사 하강법으로 최적의 경계선 S자 곡선으로 확률 출력
가중치를 고칠 때
쓰는 값
계단 함수를 거친 출력 (0 또는 1) 계단 함수를 거치기 전의 가중합 (연속적인 값) 시그모이드를 거친 출력 (0~1 확률)
특징 최초로 가중치를 조절해 학습 선형 회귀와 비슷한 방식, 연속적인 값 예측에 사용 (강의노트) 시그모이드를 활성화 함수로 사용

 

📖 보충 — 아달라인도 결국은 참·거짓을 가르는 분류기
강의노트는 아달라인을 선형 회귀와 비슷하게 연속적인 값 예측에 사용한다고 설명합니다. 정확히는 학습할 때만 연속적인 값을 씁니다. 1960년 버나드 위드로(Bernard Widrow)와 마션 호프(Marcian Hoff)가 만든 아달라인은, 계단 함수를 거치기 전의 가중합(연속적인 값)과 정답의 차이를 제곱 오차로 재고 경사 하강법으로 가중치를 고칩니다. 퍼셉트론이 계단 함수를 거친 후의 0·1 출력으로 가중치를 고치는 것과 다른 점입니다. 그리고 최종 판단에서는 가중합을 계단 함수에 넣어 참(1)과 거짓(0)을 판별합니다. 즉 아달라인은 연속적인 오차로 학습하는 분류기이고, 이 방식이 오늘의 경사 하강법 학습으로 이어졌습니다. (근거: Wikipedia, ADALINE)

 

퍼셉트론이 완성되고 아달라인이 보완하자, 다양한 문제를 해결하는 인공지능이 곧 개발될 것이라는 기대가 커졌습니다. 그러나 퍼셉트론에는 한계가 있었습니다.

 

 

 

 

07 XOR 문제 — 퍼셉트론의 한계

직선 하나로는 나눌 수 없는 문제

 

⚠️ 질문
직선의 한쪽 편에는 검은 점만, 다른 한쪽에는 흰 점만 있도록 선을 그을 수 있을까요? 네 점이 검은 점-흰 점-검은 점-흰 점처럼 대각선으로 엇갈려 있으면, 직선을 어떻게 그어도 한쪽에 두 색이 섞입니다.

 

이 질문을 컴퓨터 논리 회로로 옮긴 것이 AND, OR, XOR입니다. 입력 x1, x2의 네 가지 경우에 대한 결과를 

진리표

로 정리하면 다음과 같습니다.

 

x1 x2 AND (논리곱)
두 개 모두 1일 때 1
OR (논리합)
둘 중 하나라도 1이면 1
XOR (배타적 논리합)
하나만 1이어야 1
0 0 0 0 0
0 1 0 1 1
1 0 0 1 1
1 1 1 1 0

 

퍼셉트론이 스스로 가중치를 고치며 세 문제를 학습하게 해 보겠습니다. 예측이 틀리면 틀린 만큼 가중치와 편향을 조금씩 고치는 퍼셉트론 학습 규칙을 20번 반복합니다.

 

퍼셉트론에게 AND · OR · XOR 학습시키기

def train_perceptron(X, y, lr=0.1, epochs=20):
    w = np.zeros(2); b = 0.0
    for _ in range(epochs):
        for xi, target in zip(X, y):
            pred = 1 if np.dot(w, xi) + b > 0 else 0
            w += lr * (target - pred) * xi      # 틀린 만큼 가중치 수정
            b += lr * (target - pred)
    return w, b

X = np.array([[0, 0], [0, 1], [1, 0], [1, 1]])
gates = {"AND": [0, 0, 0, 1], "OR": [0, 1, 1, 1], "XOR": [0, 1, 1, 0]}
for name, y in gates.items():
    w, b = train_perceptron(X, np.array(y))
    pred = [1 if np.dot(w, xi) + b > 0 else 0 for xi in X]
    acc = np.mean(np.array(pred) == np.array(y)) * 100
    print(f"{name:3} : 정답 {y} / 예측 {pred} / 정확도 {acc:.0f}%")
    print("     w =", np.round(w, 2), " b =", round(b, 2))

 

▶ 실행 결과 (학습률 0.1, 20번 반복)

AND : 정답 [0, 0, 0, 1] / 예측 [0, 0, 0, 1] / 정확도 100%
     w = [0.2 0.1]  b = -0.2
OR  : 정답 [0, 1, 1, 1] / 예측 [0, 1, 1, 1] / 정확도 100%
     w = [0.1 0.1]  b = 0.0
XOR : 정답 [0, 1, 1, 0] / 예측 [1, 1, 0, 0] / 정확도 50%
     w = [-0.1  0. ]  b = 0.1

 

AND와 OR는 100% 맞혔지만 XOR는 50%에 그쳤습니다. 반복 횟수를 늘려도 마찬가지입니다. 직선 하나(w1x1 + w2x2 + b = 0)로 나눌 수 없는 문제는 아무리 가중치를 고쳐도 풀 수 없기 때문입니다. 네 점을 좌표 평면에 그려 보면 이유가 보입니다.

 

AND · OR · XOR를 좌표 평면에 그리기

import matplotlib.pyplot as plt

lines = {"AND": (0.5, 0.5, -0.7), "OR": (0.5, 0.5, -0.2)}   # 06에서 쓴 w1, w2, b
fig, axes = plt.subplots(1, 3, figsize=(12, 4))
for ax, (name, y) in zip(axes, gates.items()):
    y = np.array(y)
    ax.scatter(X[y == 1, 0], X[y == 1, 1], c='black', s=150)                        # 결과 1 : 검은 점
    ax.scatter(X[y == 0, 0], X[y == 0, 1], c='white', edgecolors='black', s=150)    # 결과 0 : 흰 점
    if name in lines:
        w1, w2, b = lines[name]
        xs = np.linspace(-0.5, 1.5, 10)
        ax.plot(xs, -(w1 * xs + b) / w2, 'r')    # w1*x1 + w2*x2 + b = 0 인 경계선
    else:
        ax.text(0.5, 0.5, '?', fontsize=30, ha='center', va='center')
    ax.set_title(name)
    ax.set_xlim(-0.5, 1.5); ax.set_ylim(-0.5, 1.5)
plt.show()

 

▶ 실행 결과 (그래프 출력)

(AND와 OR는 빨간 직선 하나로 검은 점과 흰 점이 나뉘고, XOR는 대각선으로 엇갈린 점 사이에 물음표가 나타남 — 아래 그림 4)

 

AND와 OR는 직선 하나로 나뉘고 XOR는 나눌 수 없음을 보여 주는 좌표 그래프
그림 4 · AND · OR · XOR를 좌표 평면에 나타낸 결과 (보충 실습 코드 실행 결과)

 

✅ AND · OR

· 검은 점과 흰 점을 직선 하나로 나눌 수 있음
· 퍼셉트론 하나로 해결
  ❌ XOR

· 같은 색 점이 대각선으로 마주 봄
· 어떤 직선으로도 색이 같은 점끼리 나눌 수 없음
· 퍼셉트론 하나로는 해결 불가

 

📖 XOR 문제는 어떻게 풀었나? (7주차 예고)
선을 하나가 아니라 여러 개 쓰면 됩니다. 퍼셉트론을 여러 층으로 쌓은 다층 퍼셉트론(multilayer perceptron)과, 출력의 오차를 거꾸로 전달하며 각 층의 가중치를 고치는 

오차 역전파

(back propagation)로 해결했습니다. 다음 주 주제인 7. 다층 퍼셉트론에서 자세히 다룹니다.

 

 

출처: 생성형AI가 만든 이미지 — 직선 하나로는 실패, 두 개로는 성공하는 XOR 문제

 

📖 심화 — XOR 문제가 남긴 충격
퍼셉트론의 이 한계를 널리 알린 것은 마빈 민스키(Marvin Minsky)와 시모어 페퍼트(Seymour Papert)가 1969년에 펴낸 책 Perceptrons입니다. 책은 퍼셉트론이 XOR(배타적 논리합) 같은 일부 논리 문제를 풀지 못한다는 점을 지적했고, 이 비판은 인공지능 연구에 큰 영향을 주어 한동안 신경망이 인기 없는 분야가 되었습니다. (근거: Lehigh University Libraries, Perceptrons; an Introduction to Computational Geometry)

 

❌ 시험 함정 — XOR는 선 하나로 나눌 수 없다
XOR 문제는 진리표대로 좌표 평면에 점을 찍었을 때 선을 그어 색이 같은 점끼리 나누기가 불가능한 문제입니다. 나누기가 가능하다고 하면 틀립니다. AND와 OR는 선 하나로 나눌 수 있지만 XOR는 안 된다는 점, 그리고 해결책이 다층 퍼셉트론과 오차 역전파라는 점을 함께 기억하세요.

 

 

 

08 핵심 정리

시험 직전에 이것만은 꼭

 

📌 핵심 정리

· 로지스틱 회귀 : 참(1)과 거짓(0) 사이를 구분하는 S자 형태의 선을 그어 주는 작업. Yes/No처럼 좁은 범위의 선택에 적용
· 시그모이드 함수 : S자 그래프 함수. y = 1 / (1 + e−(ax+b)) (강의노트는 1 − e로 오기). a = 경사도(클수록 가파름), b = 좌우 이동
· a·b와 오차 : a가 작을수록(0에 가까울수록) 오차 큼 / b는 너무 작거나 크면 오차 큼(이차 함수 모양)
· 오차 공식 : 참과 거짓 판단에는 평균 제곱 오차 대신 교차 엔트로피 오차. 실제 1 → −log h(파란 선), 실제 0 → −log(1−h)(빨간 선), 합치면 −{y log h + (1−y) log(1−h)}
· 케라스 실습 : Dense(1, input_dim=1, activation='sigmoid') + compile(loss='binary_crossentropy'). 최신 케라스에서는 predict(np.array([[hour]]))로 넣기
· 퍼셉트론 : 여러 입력에 가중치를 곱해 더한 가중합을 계단 함수로 판단. 가중치를 조절해 최초로 학습 수행 (1957, 로젠블랫)
· 구조 : 입력층(feature) · 가중치(중요도) · 편향(유연성) · 활성화 함수(주로 계단 함수)
· 아달라인 : 경사 하강법 도입, 최적의 경계선. 선형 회귀와 비슷, 연속적인 값 예측(강의노트) → 정확히는 학습은 계단 함수 전의 가중합(연속값)으로, 최종 판단은 계단 함수로 하는 분류기
· XOR 문제 : 진리표대로 좌표에 찍으면 선 하나로 같은 색 점끼리 나눌 수 없음 → 다층 퍼셉트론 + 오차 역전파로 해결

 

책상 위 노트에 S자 곡선과 계단 함수가 그려져 있고 노트북 화면에 신경망 그림이 빛나는 공부 장면
출처: 생성형AI가 만든 이미지 — 시그모이드와 계단 함수로 정리하는 6주차 공부

 

 

 

태그 : 로지스틱 회귀란시그모이드 함수 공식선형 회귀 로지스틱 회귀 차이교차 엔트로피 오차케라스 binary_crossentropy로지스틱 회귀 파이썬 예제퍼셉트론이란퍼셉트론 아달라인 차이XOR 문제란계단 함수 활성화 함수

 

출처 : 이 글은 부산디지털대학교(BDU)의 '파이썬 기반의 AI프로그래밍' 과목 2026년도 강의노트를 참고하여 학습용으로 작성한 글입니다.

보충 자료 (📖 보충·심화 박스의 근거)
· 시그모이드 함수의 표준 식 : Mathwords, Sigmoid Function — Definition, Formula & Graph
· 사람 뇌의 뉴런 수 : MIT CBMM (2023.5.2), How many neurons are there in human brain?, #TeachMeSomething
· 매컬럭과 피츠의 1943년 논문 : Wikipedia, A Logical Calculus of the Ideas Immanent in Nervous Activity
· 아달라인의 학습 방식 : Wikipedia, ADALINE
· 민스키와 페퍼트의 Perceptrons(1969) : Lehigh University Libraries, Perceptrons; an Introduction to Computational Geometry

반응형
:
반응형

 

🚀 [Daily] 10/08 글로벌 AI 실시간 브리핑

오픈AI 자율 연구 수학 논문 공개와 메타·시에라 에이전트 결제 인증 표준 발표

📌 오늘 이것만은 꼭! (최신 핵심 뉴스 요약)

1. 자율 학술 연구 본격화: 오픈AI, AI가 단독 집필한 수학 논문 722편 GitHub 공개: 4,000여 개 수학 난제를 해결하며 복합 이론 증명 역량을 입증했습니다.
2. 에이전트 결제 표준화: 메타·시에라, '개인 에이전트 프로토콜(PAP)' 오픈 규격 발표: 월마트·스트라이프와 연동해 AI 대리 구매 및 금융 결제를 검증합니다.
3. 멀티모달 가격 파괴: 구글, 이미지 생성 단가 50% 낮춘 'Nano Banana 2.1' 출시: 저비용으로 최대 14개 참조 이미지의 객체 일관성을 완벽 유지합니다.
4. 엔터프라이즈 인재 육성: 앤스로픽, '클로드 프런티어 아카데미'에 1억 달러 투입: 기업 도입 병목을 해소하기 위해 10,000명의 전문 엔지니어를 양성합니다.
5. 오픈소스 멀티모달: 구글, 5대 양식 통합 처리 'EmbeddingGemma 2' 아파치 2.0 배포: 텍스트부터 영상·음성까지 단일 벡터 공간으로 묶는 초경량 모델을 공개했습니다.

📋 글로벌 빅테크 뉴스룸 실시간 브리핑

1. 오픈AI, 내부 차세대 모델이 작성한 수학 연구 논문 722편 GitHub 전격 공개

오픈AI가 미공개 첨단 추론 모델을 가동해 약 4,000개의 복잡한 수학 문제를 해결하고, 이를 기반으로 완성된 722건의 정식 연구 논문 원고를 오픈소스 저장소에 공개했습니다. 인간 연구자의 개입 없이 복합 수식을 스스로 증명하고 학술 논문 형태로 체계화한 성과로, 자율 연구 에이전트(Autonomous Research Agent)가 실제 순수 과학 분야에서 상용화 단계에 진입했음을 보여줍니다.

2. 메타·시에라(Sierra), 글로벌 결제·커머스 연합과 '개인 에이전트 인증 표준(PAP)' 공개

AI 고객 서비스 플랫폼 시에라와 메타가 월마트, 쇼피파이, 스트라이프와 손잡고 개인 AI 에이전트 인증 프로토콜(Personal Agent Protocol v0.1)을 공식 발표했습니다. 사용자의 개인 AI 비서가 기업 시스템과 안전하게 통신하며 구매 의사 결정과 금융 결제를 자율 집행할 때 필요한 신원 확인 및 권한 위임 체계를 표준화하여 에이전틱 커머스 시장의 물꼬를 텄습니다.

3. 구글, 이미지 생성 비용 50% 절감한 'Nano Banana 2.1' 전격 출시

구글이 차세대 경량 모델 아키텍처를 기반으로 한 신규 비주얼 생성 엔진 'Nano Banana 2.1'을 공개했습니다. 1,000회 생성 기준 단가를 0.0336달러로 절반 가까이 낮추면서도, 최대 14개의 참조 이미지를 동시에 분석해 다중 캐릭터와 복잡한 배경의 디테일을 유지하는 연속 생성 성능을 크게 강화했습니다.

4. 앤스로픽, 기업 현장 전문 인력난 해소 위해 '클로드 아카데미'에 1억 달러 투입

앤스로픽이 기업들의 프런티어 모델 도입을 가로막는 엔지니어링 인력 부족을 해결하기 위해 'Claude Frontier Academy'를 신설하고 1억 달러를 투자하기로 결정했습니다. 사내 레거시 시스템과 자율 에이전트를 결합할 수 있는 전문 아키텍트 1만 명을 직접 육성하여 엔터프라이즈 솔루션 생태계 점유율을 공격적으로 확대한다는 방침입니다.

5. 구글, 텍스트·음성·영상 통합 'EmbeddingGemma 2' 아파치 2.0으로 완전 개방

구글이 텍스트, 프로그래밍 코드, 이미지, 오디오, 비디오 등 서로 다른 형식의 데이터를 단일 임베딩 벡터 공간에서 통합 인덱싱하는 740M 파라미터 규모의 모델을 완전 오픈소스로 공개했습니다. 모바일과 엣지 디바이스에서도 지연 시간 없이 동작하도록 설계되어 차세대 로컬 멀티모달 검색 엔진 구축을 가속화할 전망입니다.

본 브리핑은 AI Weekly, Hello Growth 글로벌 리포트 및 주요 빅테크 공식 테크 블로그를 바탕으로 엄격히 검증하여 작성되었습니다.

반응형
:
반응형

= 26/10/08 류효상의 신문을 통해 알게 된 이야기들 =

이 대통령 인사권 엄호 나선 김민석.
1. 김민석 대표가 김지용 중수청장 후보자 인선에 반발하는 당내 강경파를 겨냥해 "당에서 제어를 할 때가 됐다"고 밝혔습니다. 최근 이재명 대통령이 "무책임한 극단주의" 같은 표현을 사용하며 강경파의 지명 철회 요구를 일축하고 정면 돌파에 나선 가운데 김 대표도 지원 사격에 나서는 모양새입니다.
콩가루 집안 국민의힘도 국감에 집중하며 내분을 잠재우는 형국인데 민주당의 이런 모습.. 글쎄요~

한 끼에 하루 식비 다 쓴 민주평통.
2. 민주평화통일자문회의가 해외 자문위원들을 국내로 초청해 여는 해외지역회의에서 하루 식비 한도를 웃도는 8만 원대 호텔 만찬을 제공해 논란입니다. '하루 식비' 한도인 59달러를 사실상 '한 끼 식비'로 계산해 적용한 것으로, 이 같은 초과 집행은 2022년 이후 수년간 반복된 걸로 파악됐습니다.
정권이 바뀔 때마다 각종 논란의 핵심이며 지 할 일 못하는 이놈의 민주평통 역시 개혁의 대상임~

대법원, '룸살롱 접대' 지귀연 징계절차 진행.
3. 룸살롱 접대 의혹으로 재판에 넘겨진 지귀연 부장판사에 대해 대법원이 징계 절차를 추진할 예정이라고 밝혔습니다. 하지만 "공수처 수사를 방해하고 법원이 영장을 4번이나 기각했다"는 지적에 노경필 행정처장은 "송구하지만, 저희는 개별 사건, 특히 재판에 관여하지 않는다"고 선을 그었습니다.
영장을 4번이나 반려하는 게 자기 식구 감싸기 아니고 뭐냐? 저러고 관여하지 않는다면 개가 웃어요~

이상민, 윤석열 김건희보다 접견 많아.
4. 작년 7월부터 구속 상태인 이상민 전 행정안전부 장관이 변호인과 일반 접견을 합쳐 600건을 넘는 것으로 나타났습니다. 이는 윤석열과 김건희보다 접견 횟수가 많은 것으로, 일반 접견실이 아닌 별도 장소에서 이뤄지는 특별 접견도 7차례 있었고, 7건 모두 시작과 종료 시각은 기록돼 있지 않았습니다.
하루에 접견을 1.5회 이상 하고 수감 생활 대부분을 접견실에서 보내는 이런 특혜가 말이 되냐?

'가짜 경찰' 조롱한 20대 줄줄이 실형.
5. 6·3 지방선거 직후 잠실 올림픽 공원 개표소 시위 현장에서 한 경찰관을 30분 넘게 따라다니며 '가짜 경찰' ‘중국 공안 경찰’ 등으로 몰아세운 20대 남성 세 명이 징역 6개월의 실형을 선고받았습니다. 이들은 '진짜 경찰인 줄 몰랐다'며 고의가 아니라고 주장했지만, 재판부는 받아들이지 않았습니다.
극우 놀이에 빠져서 헤어나지 못하더니 결국 평생 전과자로 살아야 한다는 거~ 후회해도 소용없지~

버거킹, 키움증권으로 몰려간 극우들.
6. 영화 ‘암살자(들)’이 역사를 왜곡했다면서, 주연 배우 유해진 씨를 공격해 온 극우단체들이 유해진 씨 집 앞을 떠나 버거킹과 키움증권 본사 앞으로 몰려갔습니다. 배우는 자기 작품에 책임을 져야 한다며 돌연 이번 작품과는 전혀 상관없는 버거킹과 증권 회사 광고모델 활동까지 문제 삼고 나온 것입니다.
강력 대처하겠다니까 유해진 집 앞에서 일단 철수한 모양인데 이런 개들은 ‘금융 치료’가 정답임.

튀르키예·파키스탄 사우디에 파병 결정.
7. 튀르키예와 파키스탄이 이란의 지원을 받는 예멘 후티 반군으로 부터 사우디아라비아가 공격을 당하자 ‘3국의 집단방위 의무‘를 즉각 이행한다며 군 병력을 배치하기로 했습니다. 미국의 대이란 군사작전이 재개될 수 있다는 우려 속에서 이란 전쟁이 중동 전체로 확전될 가능성이 커졌다는 분석이 나옵니다.
네타냐후와 트럼프가 일으킨 전쟁이 결국 유럽 코앞에까지 확산할 모양입니다~ 진짜 걱정이 태산이네~

광주 음식점 메뉴에 5·18 비하 메뉴 논란.
8. 전남광주 동명동 한 음식점이 5·18을 폄훼하는 메뉴를 사용해 논란입니다. 극우 커뮤니티에서 광주 희생자들을 조롱하는 ‘피떡갈비’를 메뉴명으로 사용해 논란이 커지자, 해당 가게 측은 사과하고 메뉴를 바로 삭제했지만, 온라인에서는 해당 메뉴를 우연히 만들어진 것으로 보기 어렵다는 반응입니다.
이만큼 대한민국이 극우화되었다는 방증인 만큼 더 각성하고 더 단단하게 맞서 싸워야 합니다~

치킨 3사, 공정위 조사받는다.
9. 국내 주요 치킨 3사(bhc·BBQ·교촌치킨)가 공정거래위원회의 가격 담합 현장 조사를 받으며 당국의 전방위 압박에 직면했습니다. 치킨 3사는 산지 생닭 시세의 일시적 변동만으로 최종 소비자 판매가격 조정을 요구하는 것은 현실적인 외식업 원가 구조를 반영하지 못한 처사라고 항변하고 있습니다.
마트에 가면 생닭 한 마리가 4000원도 안 하는데 후라이드 한 마리가 2만3000원이면 좀 그렇지?

국민 52% "필요시 사형 집행해야".
10. 국민 절반 이상이 사형제를 유지하고 필요할 경우 집행해야 한다고 답했습니다. 국제앰네스티 한국지부의 사형제 관련 국민 인식 조사에 따르면 전체 응답자 1000명 가운데 52.9%는 한국의 사형제도에 대해 "필요할 경우 집행해야 한다"고 답했고, 지금처럼 유지해야 한다는 응답은 34.3%였습니다.
사형제를 완전 폐지해야 한다는 의견은 고작 8.5%에 불과해서 아직 법적 폐지는 어려울 듯~

이 대통령, 가수 박진영 국감 출석에 "안타깝고 미안해".
검찰 개혁 끝났는데 청와대·혁신당 공방 반복에 “자제해야”.
육영수 찾은 장동혁, 노무현 겨눈 한동훈 주도권 쟁탈전.
'명태균 여론조사' 윤석열 항소심 무죄, 1심 유죄 뒤집혀.
한동훈 공세에 맞받은 조현, 표정 지적엔 "더 이상 어떻게".
트럼프 "이란이 LA·샌디에이고 파괴하게 두라" 파문 확산.
“부캉이 보자” 구조 실패 후 방문객 늘어 100만 명 넘었다.
역대 최강 엘니뇨 온다. “다음달부터 우리나라에도 많은 비”.

무엇을 하게 되어 있든 간에 지금 당장 하라. 조건이 완벽해지는 순간은 결코 오지 않는다.
-도리스 레싱-

아마 역풍을 걱정하고 두려워하는 좀생이들에게 꼭 필요한 얘기가 아닌가 싶습니다. 개혁과 청산이 누구 눈치 봐가며 해야 할 일이라면 말 그대로 죽도 밥도 되지 못할 수 있다는 것을 먼저 걱정해야 할 것입니다.

류효상 올림.

출처 : 인천의소리(http://www.voi.co.kr)

 

인천의소리

#인천서구#인터넷신문

www.voi.co.kr

 

반응형
:
반응형

1. 삼성 성과급 윤곽 나왔다. 연봉 8000만원이면 성과급 7.5억... → 회사측이 발표한 내용을 바탕으로 노조가 각 부문별 예상액 발표. 연봉 8천 기준, 반도체 DS부문은 7.5억, 공통조직은 5.3억, 시스템LSI·파운드리사업부는 약 2.4억으로 예상. 내년 3월 말~4월초 자사주로 지급 계획.(한경)

 

 

2. 병역 특례 제도 → 1973년 도입됐다. 1972년 뮌헨올림픽 종합순위에서 한국(33위)이 북한(22위)에 밀리자 엘리트 체육을 육성하려는 목적으로 시행됐다. 그러나 53년이 흐르며 대한민국은 선진국 반열에 올랐고, 공정에 대한 눈높이는 그 어느 때보다 높아졌다. 제도를 대폭 손볼 때가 됐다.(아시아경제, 사설)

 

 

3. 산부인과 진료받는 모습이, 해외 음란 사이트에... → 병원 CCTV가 유출된 듯. 영상은 80여건으로 국내 산부인과, 성형외과, 한의원, 재활의학과 등의 내부 CCTV 영상으로 진료·환복 장면 등이 담겼다. 녹화 일자는 2022년 2월~2025년 11월로 표시돼 있어. 경찰 조사 착수(중앙)▼

해외 불법 사이트에 올라온 국내 산부인과 내부 영상

​

4. 수리비는 수입차가 비싼데… 보험료는 국산차가 더 비싸다 → 테슬라 모델Y 시리즈에 비해 현대 아이오닉5의 보험료가 더 비싸... 보험료 책정을 위한 차량 위험도 등급이 낮을수록 보험료가 높게 책정된다. 이 기준대로라면 모델Y 주니퍼(8등급)의 보험료가 아이오닉(16등급)보다 보험료가 높아야 하지만 실제로는 그렇지 않았다.(국민)

 

 

5. 佛 유럽의회 본부에 벌거벗은 트럼프 동상 → 비만한 트럼프가 왜소한 남성 어깨에 올라타고 있는 형상. ‘나는 이 사람을 돕기 위해서라면 무엇이든 하겠다. 등에서 내려오는 것만 빼고’라는 문구도 적혀 있어. 덴마크 작가의 풍자 작품... 미국은 아직 별다른 반응 없어.(동아)▼

 

 

6. ‘독감’ 이름부터 잘못... → 독감을 ‘독한 감기’ 라고 생각하지만 원인부터 다르다. 감기는 일반 바이러스에 의해 발생하고 독감은 ‘인플루엔자 바이러스’가 일으킨다. 65세 이상은 예방 접종이 무료다. 75세 이상은 6일부터, 70~74세는 12일, 65~69세는 15일부터 접종.(동아)

 

 

7. 카메라 켜지면 ‘고함’... 쇼츠 촬영장된 국감장 → 강성 지지층을 의식해 과격한 발언을 쏟아 내고 이를 담은 짧은 영상을 SNS나 온라인 플랫폼에 올리는 행태.... 댓글 창에는 “더 싸워달라” 폭주...(문화)

 

8. 무엇이든 AI에게 물어보는 중국인들 → 부작용 속출. 인민일보 등 관영 매체들도 교차 검증을 거쳐야 한다 보도. 한 예로 독버섯 여부를 AI에 물어 이를 먹었다가 중독된 사례, AI가 알려준 농약으로 농사를 망친 농부 사례 등 잇달아 보도.(헤럴드경제)

 

 

9. 부인하지 못할 축구 대표팀 내 선수 간 갈등설 → 은퇴 꺼낸 김민재·황인범·황희찬은 협회 설득으로 일단 돌려. 축구계 안팎에서는 1992년생 손흥민·이재성(마인츠), 1990년생 김승규(FC도쿄) 등 고참 라인과 1996년생 사이의 갈등이 임계점에 이르렀다는 말나와... 불만이 균열의 신호로 끝날지, 비 온 뒤 굳는 땅이 될지는 이제 선수들 스스로에게 달렸다.(중앙 외)

 

 

10. ‘우뢰’/‘우레’와 같은 박수? → ‘우레’가 맞다. 흔히 ‘우레’를 한자 ‘雨雷’(비 우, 우레 뢰)에서 온 말로 생각하지만 그 반대다. ‘우뢰’는 본래 있던 순우리말 ‘우레’에 한자를 의미에 맞춰 끼워 맞춘 말이다. ‘우레’는 ‘울다’의 ‘울’에 접미사 ‘에’가 붙은 것으로 본다. 중국어에도 ‘우뢰’는 없고 ‘뇌우’(雷雨)라는 말이 있는데 천둥을 동반한 비를 말한다.(표준국어대사전 참고)

 

이상입니다

 

 

 

2026년 10월 8일 신문을 통해 알게 된 것들

1. 삼성 성과급 윤곽 나왔다. 연봉 8000만원이면 성과급 7.5억... → 회사측이 발표한 내용을 바탕으로 노...

blog.naver.com

 

반응형
:
반응형

 

빛나는 등불을 든 사람이 텍스트와 네트워크로 가득한 동굴에서 차트 모양의 결정을 찾아내는 그림
출처: 생성형AI가 만든 이미지 — 데이터 마이닝으로 숨은 통찰을 찾는 모습

💡 1분 핵심 요약 (TL;DR)

  • ✅ 빅데이터 분석 — 대량의 데이터에서 숨겨진 패턴과 정보 간의 관계를 찾는 과정. 목표는 짧은 시간 안에 더 많은 정보 추출
  • ✅ 분석 기술 8가지 — 텍스트 마이닝 · 오피니언 마이닝 · 리얼리티 마이닝 · 소셜네트워크 분석 · 분류 · 군집화 · 기계학습 · 감성 분석
  • ✅ 데이터 마이닝 결과 — 분류 · 예측 · 시계열 분석 · 회귀 분석 · 군집화 · 연관 규칙 · 요약 · 연속성
  • ✅ 표현(시각화) 기술 — 분석 결과를 그림·그래프로 표현. 시간 · 분포 · 관계 · 비교 · 공간 시각화
  • ✅ 표현 제품 — Tag Cloud, Gephi, GraphViz, Processing, Fusion Tables, Tableau, TinkerPop, Clustergram
  • ✅ 플랫폼 활용 트렌드 — 개별 사업 부문 → 그룹 차원 → 이종 산업 간 데이터 융합
  • ✅ 활용 유형 4가지 — 처리 시점(실시간/사후) × 최적화 대상(개별/전체) / 사례 : 파리바게뜨 날씨 판매지수

📚 부산디지털대학교 '빅데이터 프로세싱' 6주차 강의노트를 바탕으로 정리한 학습 노트입니다. (출처는 글 하단 참고)

 

 

 

 

01 빅데이터 분석 기술이란

짧은 시간 안에, 더 많은 정보를

 

📖 빅데이터 분석
· 대량의 데이터로부터 숨겨진 패턴과 알려지지 않은 정보 간의 관계를 찾아내기 위한 과정
· 기존에 쓰던 분석 기술(데이터 마이닝, 예측 분석 등)의 알고리즘을 대규모 데이터 처리에 맞게 개선해 빅데이터 처리에 적용

 

✓ 기존 데이터 분석과 무엇이 다를까?
빅데이터 분석은 짧은 시간 안에 더 많은 정보를 빅데이터로부터 추출하는 것을 목표로 합니다. 분석 방법 자체가 완전히 새로운 것이 아니라, 기존 방법을 훨씬 큰 데이터에 빠르게 적용할 수 있도록 바꾼 것이라는 점이 핵심입니다.

 

 

 

 

02 분석 기술 ① 텍스트·오피니언·리얼리티 마이닝과 소셜네트워크 분석

글, 의견, 행동, 관계를 캐내다

 

분석 기술 설명 분석 대상·예
텍스트 마이닝 비·반정형 텍스트 빅데이터에서 자연어 처리(NLP: Natural Language Processing ) 기술에 기반해 의미 있는 정보를 추출하는 기술
텍스트 분석, 문서 마이닝이라고도 부름
텍스트 문서, 이메일, HTML 파일 등
오피니언 마이닝 온라인 뉴스, 소셜 미디어 코멘트, 사용자가 만든 콘텐츠에 표현된 의견을 추출·분류·이해하고 자산화하는 기술 어떤 사안·인물·이슈·이벤트에 대한 사람들의 의견이나 평가
리얼리티 마이닝 휴대폰 등 디바이스를 사용해 인간관계와 행동 양태를 추론하는 데이터 마이닝 기술 통화량, 통화 위치, 통화 상태, 대상, 내용 등
소셜네트워크 분석 수학의 그래프 이론을 바탕으로 SNS의 연결 구조와 연결 강도를 분석해 사용자의 명성과 영향력을 측정 누가 중심 인물(인플루언서)인지 파악

 

텍스트 마이닝, 오피니언 마이닝, 리얼리티 마이닝, 소셜네트워크 분석을 네 칸으로 나눠 아이콘으로 표현한 인포그래픽
출처: 생성형AI가 만든 이미지 — 빅데이터 분석 기술 네 가지

 

📖 보충 — 오피니언 마이닝과 감성 분석은 같은 분야
강의노트는 오피니언 마이닝과 감성 분석(섹션 03)을 서로 다른 기술로 나열하지만, 이 분야의 대표 연구자인 빙 리우(Bing Liu)는 '감성 분석과 오피니언 마이닝은 글에 나타난 사람들의 의견·감정·평가·태도를 분석하는 연구 분야'라고 하나의 분야로 정의합니다(Bing Liu, 『Sentiment Analysis and Opinion Mining』, 2012). 굳이 나누면 오피니언 마이닝은 '무엇에 대한 의견인가'를 찾는 데, 감성 분석은 '긍정인가 부정인가'를 판단하는 데 무게를 둔다고 볼 수 있습니다. 시험에서는 강의노트처럼 8가지를 따로 기억하세요.

 

 

 

 

03 분석 기술 ② 분류 · 군집화 · 기계학습 · 감성 분석

정답이 있는 학습과 없는 학습

 

분류 (Classification)

· 미리 알려진 클래스(정답)로 구분된 훈련 데이터를 학습시켜, 새 데이터가 속할 데이터 군을 찾음
· 지도학습 방법
· 대표 : KNN(K-최근접 이웃)
  군집화 (Clustering)

· 특성이 비슷한 데이터를 합쳐 군(그룹)으로 분류
· 훈련 데이터 군을 쓰지 않는 비지도 학습 방법
· 대표 : K-평균 군집화
· 예 : 트위터에서 사진·카메라를 주로 논의하는 사용자 군, 게임에 관심 있는 사용자 군

 

왼쪽은 정답이 붙은 점들로 새 점을 분류하고 오른쪽은 정답 없는 점들을 세 묶음으로 나누는 비교 그림
출처: 생성형AI가 만든 이미지 — 지도학습 분류와 비지도 학습 군집화의 차이

 

❌ 시험 함정 — 분류 vs 군집화
분류 = 정답이 있다(지도학습), 군집화 = 정답이 없다(비지도 학습). 둘 다 '나눈다'는 점이 같아서 헷갈리기 쉬운데, 미리 정해진 클래스가 있으면 분류, 데이터를 보고 묶음을 새로 찾으면 군집화입니다.

 

기술 설명
기계학습 · 인공지능 분야에서 인간의 학습을 모델링한 것으로, 컴퓨터가 학습할 수 있도록 하는 알고리즘과 기술 (예 : 수신한 이메일의 스팸 여부 판단)
· 기호적 학습 : 결정 트리 등
· 비기호적 학습 : 신경망, 유전자 알고리즘 등
· 확률적 학습 : 베이지안, 은닉 마코프 등
감성 분석 · 문장의 의미를 파악해 긍정/부정, 좋음/나쁨을 분류하거나 만족/불만족 강도를 지수화
· 이 지수로 고객 감성 트렌드를 시계열로 분석해, 고객 감성 변화에 신속히 대응하고 부정적 의견의 확산을 방지

 

 

 

 

04 데이터 마이닝으로 얻을 수 있는 결과

분류부터 연속성까지 8가지

 

데이터 마이닝은 마케팅 관리 시스템, 신용 평점 시스템의 신용평가 모형 개발 등 다양한 산업 분야에서 쓰입니다.

 

결과 설명 예
분류 (Classification) 일정한 집단에서 특정한 정의를 이용해 분류 및 구분을 추론 경쟁자에게로 이탈한 고객을 분류
예측 (Forecasting) 방대한 양의 데이터 집합의 패턴을 기반으로 미래를 예측 수요 예측
시계열 분석 (Time-Series) 시간 변화에 따라 일정한 간격으로 연속적인 통계 숫자를 저장한 시계열 데이터를 바탕으로 한 분석 매일 주식 값을 저장한 데이터 분석
회귀 분석 (Regression) 하나 이상의 변수 간의 영향이나 관계를 분석 및 추정 광고비가 매출에 주는 영향
군집화 (Clustering) 구체적인 특성을 공유하는 군집을 찾음. 미리 정의된 특성 정보가 없다는 점에서 분류와 다름 비슷한 행동 집단 구분
연관 규칙 (Association Rule) 동시에 발생한 사건 간의 관계를 정의 장바구니에 함께 들어가는 상품
요약(Summarization) 데이터의 일반적인 특성이나 특징의 요점을 간략히 정리하는 기술 데이터 요약 시각화
연속성(Sequencing)
(보통 순차 패턴, Sequential Pattern을 뜻함 — 아래 보충)
시간에 따라 순차적으로 나타나는 사건의 종속성 A제품을 구매한 고객이 B제품을 구매할 확율, 작년의 계절적 매출 변동 요인과 올해의 매출을 알아내는 기

 

※ '광고비가 매출에 주는 영향' 예시는 이해를 돕기 위해 덧붙였습니다.

 

분류, 예측, 시계열, 회귀, 군집화, 연관 규칙을 각각 아이콘으로 나타낸 여섯 칸 그림
출처: 생성형AI가 만든 이미지 — 데이터 마이닝으로 얻는 결과

 

❌ 시험 함정 — 회귀 분석
평가 문제의 정답은 "하나 이상의 변수 간의 영향이나 관계를 분석"입니다. "패턴 기반 미래 예측"은 예측, "특정 정의로 분류 추론"은 분류, "동시에 발생한 사건 간 관계"는 연관 규칙입니다.

 

⚠️ 데이터 마이닝의 한계
데이터 마이닝은 데이터에 의존해 현상을 해석하고 개선하기 때문에, 데이터가 현실을 충분히 반영하지 못하면 잘못된 모형을 구축하는 오류를 범할 수 있습니다.

 

 

 

 

05 빅데이터 분석 제품

자연어 처리와 기계 학습 도구들

 

제품/기술 최초 개발 주요 기능 및 특징
NLTK E. Loper 글의 문장 분할, 문장의 단어 분할 기능 제공
OpenNLP 아파치 비정형 텍스트에서 의미 있는 용어 추출
Boilerpipe C. Kohischutter
(→ Kohlschütter)
웹 페이지에서 불필요 데이터 제거 및 필요한 정보 추출
WEKA I. Witten 데이터 마이닝 및 기계 학습 알고리즘을 포함한 데이터 분석 프로그램
Mahout 아파치 확장 가능한 기계 학습 알고리즘 개발 프로젝트
Scikits_learn
(→ scikit-learn)
D. Cournapeau 오픈소스 기계 학습 라이브러리

 

※ NLTK는 Natural Language Toolkit의 약자로, 파이썬(Python)용 자연어 처리 라이브러리입니다. scikit-learn은 현재 파이썬 기계 학습의 대표 라이브러리이며 이름이 scikit-learn으로 정리되었습니다.

 

 

 

 

06 빅데이터 표현 기술과 시각화

분석 결과를 한눈에

 

📖 빅데이터 표현 기술
특정 기준에 따라 수집·저장·분석·관리 기술로 분석된 데이터의 특징이나 분석 결과를 분석가와 사용자들이 쉽게 이해할 수 있도록 그림이나 그래프 등으로 표현(시각화)해 주는 기술

 

✓ 강의노트가 강조하는 두 문장
· 빅데이터 분석에서는 가장 중요한 기술 분야가 표현 단계이며, 잘 디자인된 시각화의 도움을 받으면 훨씬 더 많은 정보를 얻을 수 있다.
· 시각화란 데이터 분석 결과를 이해하기 쉽도록 일목요연하게 보여 주는 기술과 비법을 의미한다.

 

시각화의 장점  
① 문제 파악 사용자들은 한눈에 어느 부분이 문제가 되고 주의를 요하는지 파악할 수 있음
② 큰 흐름 파악 수많은 정보를 요약해 큰 흐름을 한 번에 파악할 수 있음

 

 

시각화의 3단계

 

① 정보 구조화
데이터를 수집·정제해
구조화된 정보 생성
→ ② 정보 시각화 특성 정의
분석 도구의 도표나 그래프로
빅데이터의 특성을 시각화
→ ③ 정보 시각화
정의된 특성을 바탕으로
그래픽 요소를 추가해 완성

 

 

 

 

07 시각화 방법 5가지

시간 · 분포 · 관계 · 비교 · 공간

 

구분 주요 시각화 방법 언제 쓰나 (강의노트 그림 설명)
시간 시각화 막대 그래프, 누적 막대 그래프, 점 그래프 시계열 데이터(시간에 관련된 데이터) — 가장 큰 특징은 트렌드(경향성)
분포 시각화 파이 차트, 도넛 차트, 트리맵, 누적 연속 그래프 분포 데이터의 구분 단위인 분류, 세부 분류, 가짓수
관계 시각화 스캐터플롯, 버블 차트, 히스토그램 상관관계를 표현
비교 시각화 히트맵, 스타 차트, 평행 좌표계, 다차원 척도법 비교해야 할 변수가 둘 이상인 경우
공간 시각화 지도 맵핑 지도를 활용한 공간과 위치 정보 표현

 

※ 강의노트의 '도우넛 차트'는 '도넛 차트'로 적었습니다.

 

시간, 분포, 관계, 비교, 공간 시각화를 다섯 조각 원형 바퀴에 차트 아이콘과 함께 배치한 그림
출처: 생성형AI가 만든 이미지 — 시각화 방법 다섯 가지

 

✓ 상황별로 고르기
· 월별 매출 추이 → 시간 (막대·점 그래프)
· 매출에서 각 상품이 차지하는 비중 → 분포 (파이·트리맵)
· 광고비와 매출의 관계 → 관계 (스캐터플롯)
· 여러 지점을 여러 지표로 비교 → 비교 (히트맵·스타 차트)
· 지역별 매장 분포 → 공간 (지도 맵핑)

 

📖 보충 — 히스토그램은 '관계'보다 '분포'를 보는 그래프
강의노트는 히스토그램을 관계 시각화로 분류합니다. 하지만 히스토그램은 값을 구간(bin)으로 나눠 각 구간에 속한 개수를 막대로 그리는 그래프로, 데이터 분석 교재에서는 '하나의 수치형 변수의 분포를 이해하는 기본 도구'로 설명합니다(apxml, 탐색적 데이터 분석 과정). 두 변수의 상관관계를 보는 스캐터플롯·버블 차트와는 성격이 다릅니다. 또한 강의노트의 '분포 시각화'(파이·도넛·트리맵)는 통계에서 말하는 분포라기보다 전체 중 부분의 비중을 보여 주는 차트입니다. 시험은 강의노트 분류(히스토그램 = 관계 시각화)로 답하세요.

 

 

 

 

08 빅데이터 표현 제품

태그 구름부터 그래프 데이터베이스까지

 

제품/기술 최초 개발 주요 기능 및 특징
Tag Cloud D. Coupland 태그의 연관성에 따른 빈발도 및 관계 분석
Gephi M. Bastian 데이터를 네트워크 형태로 생성 후 표현
GraphBViz
(→ GraphViz)
AT&T 흐름도나 트리 다이어그램 생성 표현 툴
Processing MIT Media Lab. 그래픽 디자인을 위한 프로그래밍 언어
Fusion Tables 구글 대용량 데이터를 표현해 주는 온라인 서비스
Tableau P. Hanrahan 데이터의 시각적 분석과 리포팅 도구 제공
TinkerPop A. Aerbuch 그래프를 처리하는 통합 서버형 시스템
Clustergram M. Schonlau 계층적 군집화에 적합한 데이터 표현 툴
Spatial Information Flow — 특정 정보를 기준으로 데이터 흐름 표현

 

워드 클라우드, 네트워크 그래프, 흐름도, 덴드로그램과 히트맵, 대시보드를 모아 놓은 그림
출처: 생성형AI가 만든 이미지 — 빅데이터 표현 제품이 만들어 내는 시각화들

 

제품 특징
Tag Cloud · 메타데이터에서 얻은 태그들의 중요도·빈발도·인기도 등을 주제에 따라 분석해 시각적으로 늘어놓은 것
· 하나의 연결에 연관된 태그가 얼마나 많고 어떤 종류인지 잘 보여 줌
Gephi · 정제·가공하지 않은 그래프 데이터를 네트워크 형태로 생성해 시각화하는 오픈소스 프로그램
· 소셜 네트워크 관련 정보를 쉽게 이해하도록 도움
GraphViz · 데이터를 기반으로 다이어그램을 그리는 명령어 라인 네트워크 그래프 시각화 툴
· 일반적인 흐름도나 트리를 그리는 데 적합
Processing · 기존 DBN(Design By Numbers) 기반으로 만든 프로그래밍 언어
· DBN은 디자이너와 아티스트의 프로그래밍 접근도를 높여 주는 소프트웨어
· 연관 라이브러리·예시·문서가 많아 원하는 정보를 얻기 쉬움
Fusion Tables · 방대한 데이터를 스프레드시트 같은 테이블에 저장하는 온라인 시스템
· 사용자 요구에 맞게 처리하고 결과를 시각화
· 엑셀 차트와 달리 테이블을 공유 대상으로 지정, 구글 맵·스프레드시트와 연동, 엑셀·CSV 업로드 가능
Tableau · 그래프를 시각화하는 데스크톱 응용 프로그램, 시각적 분석과 리포팅 도구 제공
· 사용이 쉽고 GUI가 직관적이며, 피벗 테이블·크로스 테이블 작성을 돕는 도구 중 가장 강력한 기능 제공
TinkerPop · REST 기반 서버 형태로 시스템을 공개하며, 그래프 데이터베이스에 질의를 작성하고 상호 연결된 작업을 수행하는 서비스 모음 제공
· 세부 서비스 6가지 : Blueprints, Pipes, Gremlin, Frames, Furnace, Rexster
Clustergram · 클러스터링과 관련된 표현 소프트웨어
· 계층적 클러스터링을 수행하고 덴드로그램(Dendrogram, tree)이나 히트맵 형태로 표현

 

📖 보충 — 표현 제품, 지금은 어떻게 되었을까
· Fusion Tables : 구글은 '2019년 12월 3일 Fusion Tables와 API를 종료'한다고 공지했고, 현재는 쓸 수 없습니다(Google Workspace 업데이트 블로그, 2018.12).
· Tableau : 세일즈포스(Salesforce)가 2019년 8월 1일 인수를 완료했습니다(Salesforce 투자자 공시). 강의노트의 P. Hanrahan(팻 한라한)은 공동 창업자입니다.
· TinkerPop : 지금은 아파치 재단의 Apache TinkerPop입니다. 공식 문서에 따르면 TinkerPop3부터 Blueprints, Pipes, Gremlin, Frames, Furnace, Rexster가 모두 통합되어 'Gremlin'으로 불리며, 예를 들어 Rexster는 Gremlin Server, Pipes는 GraphTraversal이 되었습니다. 강의노트의 '세부 서비스 6가지'는 TinkerPop2 시절의 구성입니다. 위키백과의 Gremlin 문서에 따르면 TinkerPop 프로젝트는 2009년 10월에 시작되었고, 그래프 순회 언어 Gremlin은 마르코 A. 로드리게스(Marko A. Rodriguez)가 설계했습니다. 강의노트가 최초 개발자로 적은 'A. Aerbuch'가 누구인지는 공개 자료에서 확인하지 못했습니다.
· Clustergram : 강의노트가 개발자로 적은 마티아스 쇤라우(Matthias Schonlau)는 2002년 「Stata Journal」 논문에서 클러스터그램을 처음 제안했습니다. 다만 그가 말한 클러스터그램은 '군집 수를 늘려 갈 때 각 데이터가 어느 군집으로 배정되는지'를 보여 주는 그래프로, 데이터가 많아 덴드로그램을 그리기 어려울 때 쓰는 대안입니다. 강의노트가 설명하고 그림으로 보여 준 '덴드로그램 + 히트맵' 형태는 매트랩(MATLAB)의 같은 이름의 함수(clustergram) 출력으로, 이름은 같지만 서로 다른 그래프입니다.

 

 

 

 

09 빅데이터 시각화 사례

언론 · 교통 · 방역

 

사례 내용
한국언론진흥재단
민원분석 시스템
민원 건수 추이(막대 그래프), 분야별 비중(도넛 차트), 연관 키워드(워드 클라우드)를 한 화면의 대시보드로 구성
KT · 서울시 · 한국교통연구원
서울시 생활이동 데이터
서울 지도 위에 지역 간 이동 흐름을 선으로 표시하고, 남녀 유출 인구 비율·연령별 유출 인구를 함께 보여 줌
KBS
신종 코로나 데이터 시각화
확진자 발생 지역(지도), 확진자 간 감염 경로(네트워크), 확진자 목록을 함께 시각화

 

※ 사례 설명은 강의노트 그림을 글로 풀어 쓴 것입니다.

 

지역 지도 위에 이동 흐름을 빨간 선으로 그리고 옆에 성별 비율과 연령별 막대그래프를 둔 대시보드 그림
출처: 생성형AI가 만든 이미지 — 생활 이동 데이터 시각화 대시보드

 

✓ 사례로 시각화 방법 복습하기
언론진흥재단 = 시간(막대)·분포(도넛) 시각화, 생활이동 데이터 = 공간 시각화, 코로나 감염 경로 = 관계(네트워크) 시각화. 좋은 대시보드는 여러 시각화 방법을 함께 씁니다.

 

 

 

 

10 빅데이터 플랫폼 활용 트렌드 ① 개별 사업 부문

마케팅 · 행동 예측 · 리스크 관리 · 2차 수익

 

트렌드 내용
고객 소셜 미디어 활동 분석 → 마케팅 전략 · 금융 : 점포가 위치한 지역 고객의 소셜 미디어 데이터를 분석해 선호하는 예금·보험·금융 상품 개발
· 유통 : 지역 주민의 소셜 미디어 데이터로 주력 판매 제품, 매장 구도 계획 수립
소비자 행동 패턴 분석 → 행동 변화 예측 · 행동 패턴으로 고객 이탈을 조기에 감지해 타 금융기관으로의 이동을 사전 차단
· 잠재 고객 행동 분석으로 호응이 좋은 고객을 선별해 프로모션 강화, 새로운 고객층 확보
실시간 수집·분석 → 리스크 관리 · 은행 : 개인 신용도·재정 상태·행동 데이터로 대출자의 채무 불이행 가능성 판단
· 보험사·카드사 : 과거 이력 데이터로 보험 사기, 카드 부정 사용을 사전 감지하고 즉시 조사
결제 정보·매출 데이터 → 2차 수익 창출 · 카드사 : 결제 정보로 분석한 선호 업종·지역을 기반으로 고객 주변 상점의 프로모션·할인 정보를 실시간 제공
· 상점과 제휴해 상점 매출과 카드 사용을 함께 늘리는 win-win 전략

 

※ 강의노트의 '판매 전력'은 '판매 전략'의 오기로 보입니다.

 

 

 

 

11 활용 트렌드 ② 그룹 차원 · ③ 이종 산업 간 융합

데이터를 합치면 새로운 서비스가 보인다

 

그룹 차원 트렌드 사례·내용
그룹 고객 정보 통합 DB 구축·공유 일본 라쿠텐 그룹 : 온라인 쇼핑몰, 라쿠텐 은행·증권 등 계열사의 개인 정보를 통합한 '라쿠텐 슈퍼 DB'를 구축. 회원 기본 정보·구매 이력·서비스 예약 데이터를 여행·금융·신용 등 모든 서비스에서 활용
전사 고객 정보 통합·하드웨어 증설 KDB금융그룹 : 6개 계열사의 관리 회계·성과 관리·수익 관리 시스템을 그룹 데이터 웨어하우스로 통합, 계열사 데이터가 자동 연동되고 강력한 보안 체계 적용
외부 데이터 + 내부 데이터로 전략 수립 구글·네이버 검색 통계, 페이스북 등 소셜 미디어 데이터로 향후 시장·환경 변화, 소비자 트렌드 예측
자체 SNS 운영으로 의견 수집 트위터·페이스북을 고객 응대 채널로 활용 → 고객 불만에 빠르게 대응, 직접 피드백과 숨은 니즈 발견

 

 

③ 이종 산업 간 데이터 융합

 

SK + NHN

각 사가 보유한 모바일과 인터넷 정보 분석 기술을 공유해 구글맵·애플맵 등 위치 기반 서비스에 대응하고 새로운 시장 창출
  KT + 서울시

통신 빅데이터와 서울시 공공 데이터에 빅데이터 분석 기술을 접목해 시민 편의를 위한 공공 서비스 발굴에 협력

 

📖 보충 — KT와 서울시 협력의 대표 결과 — 올빼미버스
서울시 공식 매체 '내 손안에 서울'에 따르면, 서울시는 심야버스(올빼미버스) 노선을 정하기 위해 심야택시 승·하차 데이터 500만 건과 KT의 통화량 데이터 30억 건을 결합해 심야 유동인구를 분석했고, 그 결과 총 9개 노선이 만들어졌습니다. 올빼미버스는 2013년 9월 정식 운행을 시작했습니다. 통신(민간)과 교통(공공) 데이터를 합친 이종 산업 간 데이터 융합의 대표 사례입니다.

 

밤의 도시 지도 위에 휴대폰 통화량과 택시 승하차 데이터가 합쳐져 심야버스 노선이 그려지는 그림
출처: 생성형AI가 만든 이미지 — 통신 데이터와 교통 데이터를 합친 심야버스 노선

 

 

 

 

12 빅데이터 활용 효익 · 원천 · 유형

무엇을 얻고, 어디서 구하고, 어떻게 쓰나

 

효익 세부 효익 내용
전략적 가치 창출 의사결정 적시성 향상 의사결정 속도 향상, 데이터 분석의 빈도·정확성 향상
  의사결정 효과성 향상 조직 간 투입 자원과 성과의 정량적 분석
  선제적 의사결정 시장·고객 동향 분석 및 대응 방안 마련
운영 효율 향상 내부 역량 개선 문제 해결에 초점을 둔 데이터 자원 활용
  업무 자동화 및 중복 제거 데이터 수집·분석·보고서 작성 시간 단축, 저부가가치 업무의 직원 부담 경감
  프로세스 안정화 표준화된 데이터 분석 결과 제공

 

 

기업이 활용하는 빅데이터의 원천 — 입수 용이성 × 시장 가치

 

  사내 사외
핵심 데이터 자사가 보유한 독자적인 데이터로 시장 차별화가 가능한 데이터 타사가 독점적으로 보유한 데이터로 자사에서도 이용 가치가 높은 데이터
비핵심 데이터 자사가 독자적인 데이터지만 기업 차별화로 연결되지 않는 데이터 외부로부터 비교적 쉽게 입수 가능한 데이터

 

📖 풍부해진 빅데이터 원천
최근에는 기업이 필요로 하는 사내·외 데이터를 전문적으로 수집·분석해 제공하는 '데이터 어그리게이터', 인구·통계·금융 등 데이터를 한곳에 모아 거래하는 '데이터 마켓플레이스'도 등장해 빅데이터 원천이 풍부해지고 수집이 쉬워졌습니다. (2주차에서 본 '데이터 거래소'가 바로 데이터 마켓플레이스입니다.)

 

 

기업의 빅데이터 활용 유형 — 처리 시점 × 최적화 대상

 

  개별 최적화 전체 최적화
실시간 처리 특정 개인이나 사물에서 발생하는 데이터를 실시간 수집·분석해 개별적으로 활용 다수의 개인이나 사물에서 발생하는 데이터를 실시간 수집·분석해 특정 그룹에 활용
사후 처리 특정 개인이나 사물의 데이터를 시점에 상관없이 광범위하게 수집·분석해 개별적으로 활용 다수의 데이터를 시점에 상관없이 광범위하게 수집·분석해 특정 그룹에 활용

 

처리 시점과 최적화 대상을 두 축으로 나눈 네 칸 표에 각 활용 유형을 아이콘으로 넣은 그림
출처: 생성형AI가 만든 이미지 — 기업의 빅데이터 활용 유형 네 가지

 

❌ 시험 함정 — 활용 유형은 4가지
평가 문제 "기업의 빅데이터 활용 유형은 데이터 처리 시점과 최적화 대상 관점에서 4가지로 구분한다"의 정답은 O입니다. 처리 시점(실시간 vs 사후) × 최적화 대상(개별 vs 전체) = 4가지. 빅데이터의 원천(사내·사외 × 핵심·비핵심)도 4가지라 헷갈리기 쉬우니 축을 함께 외우세요.

 

✓ 예시로 구분하기
· 실시간·개별 : 내 위치에 맞춰 바로 뜨는 근처 가게 쿠폰
· 실시간·전체 : 도로 전체의 실시간 교통 흐름 안내
· 사후·개별 : 지난 1년 구매 이력으로 만든 나만의 추천
· 사후·전체 : 작년 데이터로 정한 올빼미버스 노선(섹션 11)

 

※ 예시는 이해를 돕기 위해 덧붙였습니다.

 

 

 

 

13 활용 사례 — 파리바게뜨 날씨 판매지수

날씨로 빵 주문량을 조절하다

 

날씨는 기업과 국가, 개인의 일상생활과 경제 활동에 큰 영향을 끼칩니다. 강의노트는 날씨와 유통업 매출 간의 관계를 다음과 같이 소개합니다.

 

제품 날씨와 매출의 관계
과즙 음료 · 최고 기온이 20도가 넘으면 팔리기 시작
· 25도가 넘으면 1도 상승할 때마다 판매량이 20% 증가
우유, 요구르트 · 기온 상승과 매출이 반비례하는 제품
· 20도에서 30도로 기온이 오를 때 매출은 약 8% 감소
콜라 · 25도를 넘으면 매상이 급격히 증가
· 기온이 1도 올라갈 때마다 판매량이 15% 증가
아이스크림 · 25~30도에서 매상이 늘어나며, 30도 가까이 되면 판매량이 급격히 늘어남
· 25도를 넘으면 2도 상승할 때마다 8%씩 매상 증가

 

 

추진 내용

 

① 지수 개발
최근 5년간 전국 169개 지점의
일별 매출 + 기상 자료를
통계 기법으로 지수화
→ ② 실시간 제공
날씨에 따른 판매율 =
날씨 판매지수를
점포에 실시간 제공
→ ③ 주문량 조절
가맹점이 판매량을 예측해
주문량 조절 → 기회 손실 방지,
재고 부담 감소

 

빵집 계산대 화면에 날씨와 기온에 따라 많이 팔릴 빵을 추천하는 정보가 표시된 그림
출처: 생성형AI가 만든 이미지 — 날씨 판매지수로 빵 주문량을 조절하는 빵집

 

성과 내용
매장 단말기 안내 날씨별로 잘 팔리는 빵을 파악해 점포 단말기로 주문량을 늘리도록 권장, 계산대 단말기에 '일별 날씨 판매지수 최대 변동' 제품 이름 표기
매출 증가 날씨 지수 도입 한 달 만에 조리빵 매출 30% 증가
환경 보호 폐기량 감소 → 음식물 쓰레기 감소
날씨 경영 인증 날씨 정보를 이용하는 기업에 날씨 경영 인증을 해 주며, 날씨로 인한 위험을 최소화하는 방안 마련

 

⚠️ 강의노트의 아쉬운 현실 진단
국내 기상 정보 업체는 16개 정도가 있고 날씨 관측·분석 기술도 우수하지만, 날씨를 경영과 마케팅에 적극적으로 활용하는 기업은 매우 드문 상황이라고 강의노트는 지적합니다.

 

 

 

 

14 핵심 정리

시험 직전에 이것만은 꼭

 

📌 핵심 정리

· 빅데이터 분석 : 대량의 데이터에서 숨겨진 패턴과 정보 간 관계를 찾는 과정. 목표 = 짧은 시간 안에 더 많은 정보 추출
· 분석 기술 8가지 : 텍스트 마이닝(자연어 처리, 비·반정형 텍스트), 오피니언 마이닝(의견), 리얼리티 마이닝(휴대폰으로 인간관계·행동), 소셜네트워크 분석(그래프 이론, 영향력), 분류(지도학습, KNN), 군집화(비지도 학습, K-평균), 기계학습(스팸 판단 등), 감성 분석(긍정/부정 지수화)
· 데이터 마이닝 결과 8가지 : 분류, 예측, 시계열 분석, 회귀 분석(변수 간 영향·관계), 군집화, 연관 규칙(동시 발생 사건 관계), 요약, 연속성(보통 순차 패턴 — 시간 순서가 있는 사건의 규칙)
· 데이터 마이닝의 한계 : 데이터가 현실을 반영하지 못하면 잘못된 모형 구축
· 분석 제품 : NLTK, OpenNLP, Boilerpipe, WEKA, Mahout, Scikits_learn
· 표현 기술 : 분석 결과를 그림·그래프로 표현(시각화). 장점 = 문제 부분 한눈에 파악, 큰 흐름 파악. 단계 = 정보 구조화 → 시각화 특성 정의 → 정보 시각화
· 시각화 5가지 : 시간(막대·누적 막대·점), 분포(파이·도넛·트리맵·누적 연속), 관계(스캐터플롯·버블·히스토그램), 비교(히트맵·스타 차트·평행 좌표계·다차원 척도법), 공간(지도 맵핑)
· 표현 제품 : Tag Cloud, Gephi(네트워크), GraphViz(흐름도·트리), Processing(DBN 기반 언어), Fusion Tables(구글 온라인), Tableau(데스크톱 시각 분석), TinkerPop(그래프 서버), Clustergram(계층적 군집화), Spatial Information Flow
· 활용 트렌드 : 개별 사업 부문(소셜 분석 마케팅·행동 예측·리스크 관리·2차 수익) → 그룹 차원(라쿠텐 슈퍼 DB·KDB 통합) → 이종 산업 간 융합(SK+NHN, KT+서울시)
· 활용 효익 : 전략적 가치 창출(적시성·효과성·선제적 의사결정), 운영 효율 향상(내부 역량·자동화·프로세스 안정화)
· 빅데이터 원천 : 사내/사외 × 핵심/비핵심. 데이터 어그리게이터, 데이터 마켓플레이스 등장
· 활용 유형 4가지 : 처리 시점(실시간/사후) × 최적화 대상(개별/전체)
· 파리바게뜨 : 5년간 169개 지점 매출 + 기상 자료로 날씨 판매지수 개발 → 주문량 조절, 조리빵 매출 30% 증가, 폐기량 감소

 

 

 

태그 : 빅데이터 분석 기술 종류텍스트 마이닝 오피니언 마이닝 차이분류 군집화 차이데이터 마이닝 결과 종류빅데이터 시각화 방법빅데이터 표현 제품태블로 Gephi GraphViz빅데이터 활용 유형 4가지서울시 올빼미버스 빅데이터파리바게뜨 날씨 판매지수

 

출처 : 이 글은 부산디지털대학교(BDU)의 '빅데이터 프로세싱' 과목 2026년도 강의노트를 참고하여 학습용으로 작성한 글입니다.

보충 자료 (📖 보충 박스의 근거)
· 감성 분석과 오피니언 마이닝 : Bing Liu (2012), Sentiment Analysis and Opinion Mining, Morgan & Claypool Publishers
· 히스토그램의 정의 : apxml, Visualizing Histograms, 탐색적 데이터 분석(EDA) 입문 과정
· Fusion Tables 서비스 종료 : Google Workspace Updates (2018.12), Google Fusion Tables to be shut down on December 3, 2019
· Tableau 인수 : Salesforce (2019.8.1), Salesforce Completes Exchange Offer for Tableau Common Stock, 투자자 공시
· Apache TinkerPop 구성 통합 : Apache Software Foundation, Apache TinkerPop Reference Documentation (3.3.11)
· TinkerPop 시작 시기와 Gremlin 설계자 : Wikipedia, Gremlin (query language)
· 클러스터그램(Clustergram) : Matthias Schonlau (2002), The clustergram: A graph for visualizing hierarchical and nonhierarchical cluster analyses, The Stata Journal, 2(4), 391-402
· 서울시 올빼미버스 빅데이터 사례 : 내 손안에 서울 (2014.10), [내 손안에 서울 기획] ⑤ 새벽 3시, 불 켜진 버스정류장

반응형
: