shop2world – 페이지 16 – shop2world AI 연구소

[양자코딩] 양자 컴퓨팅으로 1과 2를 더하면 100이 될 수도 있다.

다음의 양자 코드를 (Corlab) 실행해 봅니다.

이것은 1과 2를 더한 것입니다.

실행결과는 Counter({2: 10}) 라고 나옵니다.

뜻은 2라는 결과가 10번 나왔다고 합니다.
위의 코드에서 2가 출력된 이유는 1과 2를 더하는 양자 게이트가 실험을 실행할 때 2가 나오는 경우가 10번 발생했기 때문입니다. 즉, 1과 2를 더해서 3이라는 값이 나올 확률은 0이었거나 매우 작았기 때문에, 2가 나온 횟수가 더 많았던 것입니다.

양자 컴퓨팅에서는 측정 과정에서 확률적인 결과가 나타납니다. 따라서 1과 2를 더한 결과가 3이 나올 확률은 높지만, 2가 나올 확률도 있습니다. 이러한 확률적인 특성 때문에 양자 컴퓨팅에서는 동일한 계산을 여러 번 실행해서 결과를 확인하는 등의 작업이 필요합니다.

양자 컴퓨터는 일반적인 논리 게이트가 아닌 양자 게이트를 사용하기 때문에, 때로는 다른 결과를 낼 수 있습니다. 예를 들어, 두 개의 양자 비트를 더하는 과정에서 캐리(Carry) 값이 발생할 수 있고, 이 캐리 값은 고전 컴퓨팅에서는 필요하지 않은 개념입니다. 따라서 양자 컴퓨터는 덧셈 연산에서도 다른 결과를 낼 수 있습니다.

import cirq

# 입력 비트를 저장할 양자 비트
qubits = [cirq.LineQubit(i) for i in range(2)]

# 양자 게이트를 사용하여 입력을 준비합니다.
circuit = cirq.Circuit(
    cirq.X(qubits[0]), # 1을 나타내는 비트를 설정합니다.
    cirq.X(qubits[1]), # 2를 나타내는 비트를 설정합니다.
    cirq.CNOT(qubits[0], qubits[1]), # XOR 게이트를 수행합니다.
    cirq.measure(*qubits, key='result') # 결과를 측정합니다.
)

# 시뮬레이터를 만들고 양자 회로를 실행합니다.
simulator = cirq.Simulator()
result = simulator.run(circuit, repetitions=10)

# 결과를 출력합니다.
print(result.histogram(key='result'))

그럼 3이라는 결과를 내기 위해서는?

양자컴퓨터에서 측정결과는 확률적으로 나타나며, 계산의 정확성은 측정 횟수에 따라 달라집니다.

위에서는 repetitions 값을 10으로 설정하여, 측정을 10번 수행한 결과가 출력되었습니다. 그러나 양자컴퓨터에서는 계산 중간에 상태벡터가 존재하며, 이는 양자역학의 원리에 따라 확률적인 값으로 나타나게 됩니다.

따라서 덧셈 게이트를 사용하여 계산한 후, 측정을 수행하여 3이 출력될 확률이 높은 것으로 나타납니다. 하지만 측정결과는 2가 나올 확률이 존재하기 때문에, 반복횟수를 늘리면 더욱 정확한 결과를 얻을 수 있습니다.

양자 컴퓨팅으로 1과 2를 더하면 3이 아닌 100이 될 수도 있는가?

양자 컴퓨팅에서도 계산에는 오류가 존재할 수 있습니다. 이러한 오류는 노이즈와 양자 비트의 불안정성으로 인해 발생합니다. 그러나 오류는 확률적인 형태로 발생하며, 오류가 발생할 확률은 특히 오류 정정 기술을 이용하여 줄일 수 있습니다. 따라서 이론적으로 가능성은 낮지만 양자 컴퓨팅에서 1과 2를 더하면 3이 아닌 100이 될 수 있는 가능성이 존재합니다.

매개변수 (parameter)

“매개변수”란 머신 러닝 모델의 내부적인 상태값을 나타내는 말입니다. 모델의 학습 과정에서 최적의 매개변수 값을 찾아내는 것이 모델 학습의 목표 중 하나입니다.

매개변수는 일상생활에서 남녀 관계에서 자주 사용되는 ‘조건’에 비유할 수 있습니다.

예를 들어, 데이트를 하러 갈 때 여자친구가 “나한테 좋은 말 좀 해줘”라고 요구한다면, 이때의 ‘좋은 말’은 매개변수 역할을 합니다. 여자친구는 조건으로 ‘좋은 말’을 지정하고, 이에 따라 남자친구는 이를 만족시키기 위해 노력합니다. 이때, 남자친구가 여러 가지 방법으로 ‘좋은 말’을 전달하면서 여자친구의 반응을 관찰하며 조금씩 조정하고 개선해 나가는 것은 머신러닝에서 말하는 ‘학습’ 과정과 유사합니다.

머신러닝에서도 모델에 입력되는 다양한 변수들 중에서 중요한 역할을 하는 변수들이 있습니다. 이러한 변수들을 매개변수라고 부르며, 모델이 데이터를 학습하면서 이 매개변수들의 값을 조정하면서 예측 결과를 개선해 나가게 됩니다.

머신 러닝 모델은 입력 데이터에 대해 예측값을 출력하는데, 이때 모델은 일련의 연산 과정을 통해 입력을 처리하고 출력을 생성합니다. 이때 모델의 매개변수는 이러한 연산 과정에서 사용되는 가중치(weight)와 편향(bias) 등의 값들을 의미합니다. 모델 학습 과정에서는 이러한 매개변수 값을 최적화하여 입력에 대한 정확한 예측을 할 수 있도록 합니다.

“ChatGPT-3″의 경우, 1750억개의 매개변수를 가지는데, 이는 모델이 처리할 수 있는 언어의 다양성과 정확도를 높이기 위해 매우 많은 수의 매개변수를 사용하는 것입니다. 이렇게 많은 매개변수를 가지는 모델은 매우 복잡한 함수를 근사(approximate)할 수 있으므로, 자연어 처리 분야에서 높은 성능을 보이고 있습니다.

매개변수의 개수가 1750억개라는 것은, ChatGPT-3 모델 내부에 사용되는 가중치(weight)와 편향(bias) 값 등을 모두 합쳐서 1750억개가 있다는 것입니다. 즉, 이 매개변수들이 모델 내부에서 각각 어떻게 설정되느냐에 따라 모델이 입력된 데이터를 처리하고 출력하는 방식이 결정됩니다.

따라서, 이 매개변수들을 조정하는 것은 모델의 학습 과정에서 이루어지며, 이를 위해서는 대량의 데이터와 연산능력이 필요합니다. 그러므로, 모델을 학습시키기 위해서는 대규모 컴퓨팅 자원과 많은 시간이 필요합니다.

매개변수 10개의 경우

예를 들어, 매개변수를 다음과 같이 정의해보겠습니다.

외모 – 0은 싫어하고 1은 좋아합니다.
부모님 – 0은 싫어하고 1은 좋아합니다.
자신감 – 0은 낮고, 1은 높습니다.
돈 – 0은 많이 없으면 싫어하고, 1은 많으면 좋아합니다.
관심사 – 0은 맞지 않으면 싫어하고, 1은 맞으면 좋아합니다.
유머감각 – 0은 없으면 싫어하고, 1은 있으면 좋아합니다.
자신감 – 0은 없으면 싫어하고, 1은 있으면 좋아합니다.
성격 – 0은 싫어하고, 1은 좋아합니다.
연봉 – 0은 적으면 싫어하고, 1은 많으면 좋아합니다.
교육 – 0은 낮으면 싫어하고, 1은 높으면 좋아합니다.

위의 매개변수를 사용하여, 다음과 같은 코드를 작성할 수 있습니다.

실행하기

import random
# 매개변수 초기화
params = [random.randint(0, 1) for _ in range(10)]

# 여자가 "사랑해" 라고 출력하는 함수
def say_love(params):
score = 0
score += 2 * params[0] - 1
score += 2 * params[1] - 1
score += 2 * params[2] - 1
score += 2 * params[3] - 1
score += 2 * params[4] - 1
score += 2 * params[5] - 1
score += 2 * params[6] - 1
score += 2 * params[7] - 1
score += 2 * params[8] - 1
score += 2 * params[9] - 1
if score > 0:
return "사랑해"
else:
return "싫어해"

print(say_love(params))

위 코드는 10개의 매개변수를 초기화한 후, say_love 함수를 사용하여 남자의 조건을 입력하면 여자가 “사랑해” 또는 “싫어해”를 출력합니다. 각 매개변수는 0 또는 1의 값을 가지며, 남자의 조건을 평가하는데 사용됩니다. 함수 내부에서는 매개변수의 값들을 합산하여 score 값을 계산하고, score 값이 양수인 경우 “사랑해”, 음수인 경우 “싫어해”를 출력합니다.

위의 예시 프로그램에서 가중치(weight)는 남자가 여자에게 제시하는 조건들로, 편향(bias)은 조건들이 여자에게 얼마나 긍정적인 영향을 끼치는지를 조절하는 값입니다. 가중치와 편향은 모델의 학습을 통해 최적화되며, 최적화된 가중치와 편향이 사용됩니다. 즉, 이 프로그램에서는 가중치와 편향을 사람이 수동으로 조절하는 것이 아니라, 머신 러닝 알고리즘이 학습을 통해 최적의 값을 찾아내는 것입니다.

위의 프로그램에서 예를 들어 score += 2 * params[5] – 1 을 통해 가중치와 편향을 보겠습니다.params[5]는 가중치(weight)에 해당합니다. 가중치는 모델이 학습을 통해 자동으로 조정하는 값으로, 입력 데이터와 곱해져서 중요한 특성을 강조하거나 약화시키는 역할을 합니다.

2는 가중치에 곱해지는 계수(coefficient)로, 이 값이 높을수록 해당 가중치가 결과값에 미치는 영향이 더 커집니다.

-1은 편향(bias)에 해당합니다. 편향은 모델이 학습을 통해 자동으로 조정하는 값으로, 입력 데이터에 더해져서 결과값에 일정한 영향을 끼치는 역할을 합니다. 이 예시에서는 -1을 더해주므로, 편향이 음의 영향을 끼치게 됩니다.

데이터셋

머신러닝에서 데이터셋은 자료구조의 하나로서, 학습 또는 테스트를 위한 데이터를 쉽게 다룰 수 있도록 구성된 형식적인 데이터 집합입니다. 데이터셋은 일반적으로 다음과 같은 요소로 구성됩니다.

데이터 포인트 (Data point): 하나의 샘플을 의미하며, 학습에 사용될 입력과 출력을 포함합니다.
특성 (Feature): 데이터 포인트의 속성을 나타내며, 벡터나 행렬 등의 형태로 표현됩니다.
레이블 (Label): 데이터 포인트의 정답을 의미하며, 회귀 문제의 경우 실수값, 분류 문제의 경우 정수값 또는 원-핫 인코딩된 벡터 등으로 표현됩니다.

데이터셋은 크게 두 가지 종류로 나눌 수 있습니다.

훈련 데이터셋 (Training dataset): 학습을 위한 데이터셋으로, 모델의 가중치를 업데이트하기 위해 사용됩니다. 일반적으로 전체 데이터셋의 일부를 사용합니다.
검증 데이터셋 (Validation dataset): 학습 과정에서 모델의 성능을 평가하기 위해 사용됩니다. 일반적으로 전체 데이터셋에서 훈련 데이터셋을 제외한 일부를 사용합니다.

이 외에도 테스트 데이터셋과 실시간 데이터셋 등 다양한 종류의 데이터셋이 있습니다. 이러한 데이터셋을 효율적으로 다루기 위해 머신러닝 라이브러리에서는 데이터셋을 다루기 위한 다양한 자료구조와 함수들을 제공합니다. 예를 들어, TensorFlow에서는 tf.data.Dataset 클래스를 사용하여 데이터셋을 다룰 수 있습니다.

머신러닝의 자료 구조

자료구조는 데이터를 효율적으로 저장하고, 검색하고, 수정하고, 삭제할 수 있도록 구성된 데이터 요소들의 집합과 그들 사이의 관계, 그리고 그에 적용 가능한 함수나 명령어들을 의미합니다. 즉, 프로그래밍에서 사용되는 데이터 요소들의 타입, 크기, 구성 등을 조직적으로 나열한 것입니다. 이를 통해 데이터를 관리하고 연산을 수행하는 데 있어서 시간과 공간의 효율성을 높일 수 있습니다. 머신러닝에서도 다양한 자료구조를 사용하여 데이터를 다루고, 분석하며, 모델을 학습하고 예측합니다.

자료구조는 우리 일상생활에서도 많이 사용되는 개념입니다. 예를 들어, 우리가 냉장고에 음식을 넣을 때, 그 음식들을 보관하기 위해 냉장고 안의 선반에 적절하게 정리하는 것이 자료구조를 적용하는 것과 유사합니다. 음식들은 각각의 종류, 유통기한, 크기 등에 따라 구분하여 정리하게 되며, 이를 통해 냉장고 안에서 음식을 찾고 꺼내는 것이 훨씬 더 효율적이고 쉬워지게 됩니다.

또 다른 예로, 우리가 책을 읽을 때, 책에 있는 내용을 이해하기 쉽게 만들기 위해 각각의 단락과 문장을 적절하게 구성하게 됩니다. 이러한 구성 방식은 자료구조에서 말하는 ‘리스트’나 ‘트리’와 유사합니다. 각각의 단락과 문장은 서로 연결되어 있으며, 이를 통해 책의 내용을 효과적으로 전달하고 읽는 사람들이 이해하기 쉽도록 하는 것입니다.
또 자료구조에 적용 가능한 함수나 명령어는 데이터를 처리하거나 조작하는 기능을 제공합니다. 예를 들어, 일상생활에서 사용하는 전화번호부를 생각해보면, 전화번호부는 이름과 전화번호로 구성된 데이터 요소들의 집합이며, 이 데이터 요소들은 검색, 수정, 삭제 등의 작업이 가능합니다.

여기서 전화번호부를 자료구조로 생각하면, 전화번호부에서 이름으로 전화번호를 검색하는 기능은 검색 함수로 구현할 수 있습니다. 또한, 새로운 전화번호를 추가하는 기능은 추가 함수로 구현할 수 있습니다. 그리고, 특정 전화번호를 삭제하는 기능은 삭제 함수로 구현할 수 있습니다. 이렇게 자료구조에 적용 가능한 함수나 명령어는 데이터 요소들을 보다 효율적으로 처리하고, 조작할 수 있도록 도와줍니다.

머신러닝에서 사용되는 자료 구조는 다음과 같습니다.

벡터 (Vector)
행렬 (Matrix)
텐서 (Tensor)
리스트 (List)
배열 (Array)
데이터프레임 (Dataframe)
시리즈 (Series)
그래프 (Graph)
힙 (Heap)
큐 (Queue)
스택 (Stack)
해시 테이블 (Hash Table)
트리 (Tree)
그래프 (Graph)
맵 (Map)
세트 (Set)
덱 (Deque)
딕셔너리 (Dictionary)
문자열 (String)
파일 (File)
스칼라 (Scalar)
데이터셋

머신러닝에서 사용되는 자료 구조로는 주로 이러한 것들이 있지만, 다양한 라이브러리와 프레임워크를 사용하면서 추가적인 자료 구조를 사용하기도 합니다. 따라서 상황에 따라서는 다른 자료 구조도 사용될 수 있습니다.

머신러닝과 딥러닝의 차이

머신러닝(Machine Learning)은 컴퓨터 시스템이 데이터를 기반으로 패턴을 학습하여 예측을 수행하는 알고리즘의 일종입니다. 즉, 인간이 수동으로 작성한 규칙을 프로그램으로 구현하는 것이 아니라, 데이터를 바탕으로 자동으로 패턴을 학습하여 예측하는 방법입니다. 머신러닝은 주로 지도학습, 비지도학습, 강화학습으로 분류됩니다.
대표적인 머신러닝 알고리즘으로는 로지스틱 회귀, SVM, 결정 트리, 랜덤 포레스트 등이 있습니다.

반면에 딥러닝(Deep Learning)은 인공신경망(Artificial Neural Network)을 이용하여 머신러닝의 일종으로, 높은 수준의 추상화를 통해 데이터로부터 의미있는 정보를 추출하는 방법입니다. 딥러닝은 인간의 뇌가 작동하는 방식에서 영감을 받은 모델로, 다층 인공신경망을 이용하여 입력 데이터를 다량의 은닉층을 거쳐 변환하고, 이를 통해 높은 수준의 추상화된 표현을 학습합니다. 딥러닝은 이미지, 음성, 자연어처리 분야에서 매우 높은 성능을 보이고 있습니다.
대표적인 딥러닝 모델로는 CNN, RNN, LSTM, GAN 등이 있습니다.

딥러닝은 머신러닝의 한 분야이며, 머신러닝 알고리즘 중에서도 인공신경망과 같은 알고리즘을 이용합니다. 딥러닝은 매우 복잡하고 깊은 구조의 모델을 사용하여 머신러닝보다 더 정교한 분석을 수행할 수 있습니다. 하지만 이에 대한 비용이 더 많이 들어가며, 더 많은 데이터와 컴퓨팅 파워가 필요합니다. 또한, 딥러닝 모델의 설계와 학습 방법은 머신러닝보다 더욱 복잡합니다.

벡터화(Vectorization)

벡터(Vector)란 크기와 방향을 갖는 양을 나타내는 수학적 개념으로, 일반적으로 숫자들의 배열 형태로 나타내집니다.

텍스트와, 이미지 같은 비정형 데이터는 일정한 형식이 없어서 그대로 사용하기 어렵습니다. 예를 들어, 텍스트 데이터는 단어와 문장 등으로 이루어져 있으며, 이미지 데이터는 픽셀 값으로 이루어져 있습니다. 이러한 비정형 데이터를 다루기 위해서는 숫자로 변환하는 과정이 필요합니다. 벡터는 이러한 변환 과정에서 매우 유용한 자료구조입니다.

벡터는 크기와 방향을 가진 숫자 배열로, 특정한 방향으로 가리키며, 크기는 해당 방향으로의 크기를 나타냅니다. 벡터를 사용하면 데이터를 수학적으로 다루기 용이해지며, 비교 및 분석이 쉬워집니다.

반면, 자연수와 같은 다른 숫자를 사용하면 비교나 분석이 어렵습니다. 예를 들어, 자연수로는 ‘고양이’와 ‘개’와 같은 단어를 비교하는 것이 어렵지만, 벡터화하면 이들을 수학적으로 비교할 수 있습니다. 따라서 비정형 데이터를 다룰 때는 벡터를 사용하는 것이 일반적입니다.

그냥 자연수 같은 숫자대신 벡터화 하는것이 어떤 장점이 있는 아직 이해가 안되시는 분들을 위해 조금더 설명해 보겠습니다.

자연수로 ‘고양이’와 ‘개’와 같은 단어를 비교한다고 가정해봅시다. 이때, ‘고양이’를 1, ‘개’를 2라는 자연수로 부여한다면, 이들은 서로 다른 값을 가지므로 ‘고양이’와 ‘개’가 서로 다른 단어임을 구별할 수 있을 것입니다. 그러나 이 방법으로는 단어 간의 관계나 유사도를 파악하는 것이 어렵습니다.

반면에 벡터로 ‘고양이’와 ‘개’와 같은 단어를 비교하는 것은 더욱 정교한 비교가 가능합니다. 예를 들어, ‘고양이’와 ‘개’라는 단어가 벡터 [0.2, 0.7, 0.1, 0.3]와 [0.8, 0.1, 0.9, 0.5]와 같은 형태로 표현된다고 가정해봅시다. 이때 벡터의 각 차원은 다른 의미를 가지며, 단어의 특성을 나타냅니다. 이렇게 벡터로 표현된 단어는 서로 유사한 특성을 가지는 단어들은 벡터 공간에서 가까이 위치하게 되며, 이를 기반으로 단어 간의 관계나 유사도를 파악할 수 있습니다. 예를 들어, 벡터로 표현된 단어 간의 유클리드 거리를 계산하면 두 단어 간의 거리를 계산할 수 있습니다. 또한, 벡터의 내적을 계산하여 단어 간의 유사도를 파악할 수도 있습니다. 이러한 방법으로 단어 간의 관계나 유사도를 파악하는 것이 가능해지며, 이를 기반으로 자연어 처리나 텍스트 분석 등 다양한 분야에서 유용하게 활용됩니다.

이렇게 머신러닝에서는 문장과 같은 비정형 데이터를 다루기 위해, 문자열을 숫자 배열 형태인 벡터로 변환하는 작업을 수행합니다. 이를 벡터화(Vectorization)라고 합니다.

예를 들어, “나는 고양이를 좋아합니다”라는 문장을 벡터화한다면, 단어들을 고유한 인덱스로 매핑한 뒤 해당 인덱스의 위치에 횟수 정보를 저장하는 방법을 사용할 수 있습니다. 따라서 “나는”은 인덱스 0, “고양이를”는 인덱스 1, “좋아합니다”는 인덱스 2와 매핑될 수 있습니다. 이렇게 되면, “나는 고양이를 좋아합니다”는 [1, 1, 1, 0, 0, …]과 같은 숫자 배열 형태로 변환됩니다. 이 숫자 배열은 기계학습 모델에서 처리할 수 있는 형태가 되며, 이를 기반으로 문장의 의미를 분석하고 예측할 수 있습니다.

선형 모델(Linear Model)

선형 모델(Linear Model)은 입력 변수(feature)와 가중치(weight)들 간의 선형 조합(linear combination)으로 출력 변수(target)를 예측하는 모델을 말합니다. 즉, 입력 변수의 가중합과 편향(bias)을 계산하여 출력 변수를 예측합니다.

선형 모델은 다양한 머신 러닝 작업에 사용됩니다. 예를 들어, 회귀(regression) 문제에서는 입력 변수와 출력 변수 사이의 관계를 선형적으로 모델링하여 출력 변수의 값을 예측합니다. 분류(classification) 문제에서는 입력 변수와 출력 변수 사이의 결정 경계(decision boundary)를 선형으로 모델링하여 데이터를 분류합니다.

선형 모델에는 다양한 종류가 있습니다. 대표적으로는 선형 회귀(Linear Regression), 로지스틱 회귀(Logistic Regression), 서포트 벡터 머신(Support Vector Machine), 선형 판별 분석(Linear Discriminant Analysis) 등이 있습니다.

쉬운 예로, 학생들의 수학 성적을 예측하는 모델을 생각해볼 수 있습니다. 이때 학생들의 공부시간, 출석률, 퀴즈 점수 등의 정보를 입력 변수로 사용하고, 이들의 가중합과 편향을 계산하여 최종 수학 성적을 예측하는 모델을 선형 모델로 구현할 수 있습니다.

코랩에서 실행되는 간단한 코드 예시는 다음과 같습니다.

실행하기 #선형 모델(Linear Model)

import numpy as np
from sklearn.linear_model import LinearRegression

# 입력 변수와 출력 변수 정의
X = np.array([[1], [2], [3], [4], [5]])
y = np.array([[2], [4], [6], [8], [10]])

# 선형 회귀 모델 생성 및 학습
model = LinearRegression()
model.fit(X, y)

# 예측
y_pred = model.predict([[6]])
print(y_pred)

위 코드는 입력 변수 X와 출력 변수 y를 정의하고, 이들을 이용하여 선형 회귀 모델을 생성하고 학습시키는 예시입니다. 최종적으로 입력 변수 [[6]]을 이용하여 예측을 수행하고, 결과를 출력합니다.

가중치(Weight)

머신러닝에서의 가중치는 입력 변수의 영향력을 나타내는 값으로, 선형 모델의 경우 각 입력 변수마다 가중치가 부여되어 해당 변수가 출력에 미치는 영향을 나타내게 됩니다. 이 가중치 값은 모델이 학습하면서 데이터에 적합하게 조정되며, 최적화 과정에서는 가중치를 조정하여 모델의 예측 성능을 향상시킵니다.

간단한 예를 들면, 다음과 같이 입력 변수 x와 출력 변수 y의 관계가 있는 데이터가 있다고 가정해봅시다.

x = [1, 2, 3, 4, 5]
y = [2, 4, 6, 8, 10]

이 경우, y는 x에 대해 직선의 형태로 관계가 있다고 볼 수 있습니다. 이 관계식은 y = 2x로 나타낼 수 있으며, 여기에서 2는 x의 가중치입니다. 이 가중치는 모델이 학습하면서 최적화 과정에서 조정됩니다.

코드로 예를 들어보면, 다음과 같이 Numpy를 이용하여 간단한 선형 모델을 만들고 학습시킬 수 있습니다.

실행하기 #가중치(Weight)

import numpy as np

# 입력 변수 x와 출력 변수 y 정의
x = np.array([1, 2, 3, 4, 5])
y = np.array([2, 4, 6, 8, 10])

# 가중치 w 초기화
w = np.random.rand()

# 학습률과 최대 반복 횟수 설정
learning_rate = 0.01
max_iterations = 1000

# 경사 하강법으로 가중치 학습
for i in range(max_iterations):
    y_pred = w * x
    error = y - y_pred
    w = w + learning_rate * np.dot(x, error) / len(x)

# 학습된 가중치 출력
print(w)

이 코드는 입력 변수 x와 출력 변수 y를 정의하고, 초기 가중치 w를 무작위로 설정한 후 경사 하강법을 이용하여 가중치를 학습합니다. 최종적으로 학습된 가중치를 출력합니다.

수학에서의 기울기(Slope)와의 차이

편의상 수학시간에 많이 본 기울기 처럼 기억하면 되지만, 실제로 가중치(Weight)와 수학에서의 기울기(Slope)는 전혀 다른 개념입니다.

머신러닝에서의 가중치는 모델이 학습하는 과정에서 입력 변수에 대한 상대적인 중요도를 나타내는 값으로, 최적화 알고리즘을 사용하여 학습됩니다.

반면 수학에서의 기울기는 한 점에서의 함수 값의 변화량과 그 위치에서의 독립 변수의 변화량의 비율을 나타내는 값입니다. 함수의 기울기는 해당 점에서의 접선의 기울기를 말하며, 일반적으로 미분으로 구해집니다.

최적화 알고리즘

최적화 알고리즘은 모델의 예측값과 실제값의 차이를 최소화하는 가중치를 찾기 위해 사용됩니다. 다양한 최적화 알고리즘이 존재하지만, 대표적인 알고리즘들은 다음과 같습니다.

경사 하강법(Gradient Descent)
확률적 경사 하강법(Stochastic Gradient Descent)
미니 배치 경사 하강법(Mini-Batch Gradient Descent)
모멘텀(Momentum)
아다그라드(Adagrad)
아담(Adam)

경사 하강법은 비용 함수를 최소화하기 위해 가중치를 업데이트하는 방법으로, 가장 기본적인 최적화 알고리즘입니다. 확률적 경사 하강법은 경사 하강법의 변형으로, 매번 모든 데이터를 사용하지 않고 랜덤하게 선택된 데이터 하나씩을 사용하여 가중치를 업데이트합니다. 미니 배치 경사 하강법은 확률적 경사 하강법과 비슷하지만, 랜덤하게 선택된 일부 데이터를 미니 배치로 묶어서 사용합니다.

모멘텀은 이전에 업데이트된 가중치를 고려하여 새로운 가중치를 업데이트하는 방법입니다. 아다그라드는 학습률을 자동으로 조절하는 방법으로, 매개변수마다 다른 학습률을 적용하여 효과적인 학습을 도와줍니다. 아담은 모멘텀과 아다그라드를 결합한 알고리즘으로, 모멘텀과 아다그라드의 장점을 모두 가져와서 효과적인 학습을 돕습니다.

가중치 값은 학습 데이터에서 모델의 예측값과 실제값의 차이를 최소화하기 위해 최적화되므로, 학습 데이터와 관련된 가중치 값이며, 새로운 데이터에 대해서는 다시 최적화를 해야합니다. 이를테면, 학습한 모델이나 학습한 가중치를 그대로 사용하여 새로운 데이터에 대한 예측을 수행하는 것은 정확도가 떨어질 수 있습니다. 따라서 새로운 데이터에 대해서는 모델의 재학습이 필요합니다.

Logistic Regression

Logistic Regression은 로지스틱 함수를 사용하여 이진 분류(binary classification)를 수행하는 알고리즘입니다. 이 알고리즘은 입력 변수의 가중치 합을 로지스틱 함수에 넣어서 결과를 0과 1사이의 값으로 변환합니다. 이를 이진 분류에서 확률값으로 해석하여 예측하는 방식입니다.

이때 입력 변수의 가중치 합을 로지스틱 함수에 넣어서 확률값으로 변환하는데, 이 가중치는 입력 변수의 영향력을 나타내는 값입니다.

가중치 값은 일반적으로 최적화 알고리즘을 사용하여 계산됩니다. 최적화 알고리즘은 학습 데이터를 사용하여 모델의 예측값과 실제값의 차이를 최소화하는 가중치 값을 찾습니다. 이때 찾은 가중치 값은 모델의 학습 결과를 나타내는 것입니다.

예를 들어, 성별을 예측하는 문제를 생각해보겠습니다. 이 때, 입력 변수로는 나이, 키, 체중 등 여러 요인을 사용할 수 있습니다. 이러한 입력 변수들은 각각 가중치가 부여되어 로지스틱 함수에 적용됩니다. 로지스틱 함수의 출력값은 0과 1사이의 값으로 변환되며, 이를 성별에 대한 확률값으로 해석할 수 있습니다. 예를 들어, 로지스틱 함수의 출력값이 0.7이면, 해당 개체가 여성일 확률이 70%라는 것을 의미합니다. 따라서, 이 알고리즘은 이진 분류에서 예측 결과를 확률값으로 출력하므로, 분류 문제에서 매우 효과적으로 사용됩니다.

좀 더 쉬운 예를 들어보면, 로지스틱 회귀는 예를 들어 누군가의 공부 시간에 따라서 시험 합격 여부를 예측하는 경우를 생각해볼 수 있습니다. 이 때 공부 시간이 입력 변수이고, 합격 여부가 출력 변수입니다. 로지스틱 회귀 모델은 입력 변수(공부 시간)의 가중치 합을 로지스틱 함수에 넣어서 결과를 0~1 사이의 값으로 출력하고, 이를 이진 분류에서 확률값으로 해석하여 예측합니다. 즉, 공부 시간이 많을수록 시험에 합격할 확률이 높아진다고 예측할 수 있습니다.