딥러닝의 음성인식 — 목소리를 글자로 바꾸는 원리

📘 코딩이란? 강좌 · 3-7단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 음성인식이란 음성인식(Speech Recognition)은 사람의 목소리를 텍스트로 바꾸는 기술입니다. 스마트폰의 음성 비서, 자막 자동 생성, 받아쓰기 앱이 모두 이 기술을 사용합니다. 소리에서 글자까지의 과정 소리 입력 : 마이크로 음성 파형을 받아들입니다. 특징 추출 : 파형을 주파수 성분으로 분석해(스펙트로그램) 기계가 다루기 좋은 형태로 바꿉니다. 변환 : 신경망이 이 … 더 읽기

딥러닝 알고리즘 IV · 트랜스포머 — 생성형 AI의 심장

📘 코딩이란? 강좌 · 3-6단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 트랜스포머(Transformer)란 트랜스포머는 2017년 발표된 신경망 구조로, 오늘날 거대 언어 모델과 생성형 AI의 바탕이 되는 핵심 기술입니다. RNN의 한계를 넘어 자연어 처리의 판도를 바꿔 놓았습니다. 어텐션(Attention)이 핵심이다 트랜스포머의 심장은 어텐션 메커니즘입니다. 문장 안의 모든 단어가 서로 얼마나 관련 있는지를 계산해, 중요한 단어에 더 ‘집중’합니다. 예를 들어 “그 … 더 읽기

딥러닝 알고리즘 III · RNN — 순서가 있는 데이터를 다루다

📘 코딩이란? 강좌 · 3-5단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 순환 신경망(RNN)이란 RNN(Recurrent Neural Network)은 문장, 시계열, 음성처럼 순서가 중요한 데이터를 다루기 위한 신경망입니다. 앞에서 본 정보를 기억해 뒤의 판단에 활용한다는 점이 특징입니다. 이전 정보를 기억하는 구조 일반 신경망은 입력을 각각 독립적으로 처리하지만, RNN은 이전 단계의 계산 결과(은닉 상태, hidden state)를 다음 단계로 넘겨줍니다. 덕분에 “나는 … 더 읽기

딥러닝 알고리즘 II · CNN — 이미지를 잘 보는 신경망

📘 코딩이란? 강좌 · 3-4단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 합성곱 신경망(CNN)이란 CNN(Convolutional Neural Network)은 이미지처럼 격자 형태의 데이터를 처리하는 데 특화된 신경망입니다. 사진 분류, 얼굴 인식, 의료 영상 판독 등 컴퓨터 비전 분야를 이끌고 있습니다. 왜 이미지에 특별한 구조가 필요할까요? 이미지를 픽셀 하나하나 일반 신경망에 넣으면 입력이 너무 많아지고, 위치가 조금만 달라져도 다른 데이터로 인식하는 … 더 읽기

딥러닝 알고리즘 I · 인공신경망(ANN) — 딥러닝의 기본 뼈대

📘 코딩이란? 강좌 · 3-3단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 인공신경망(ANN)이란 인공신경망(Artificial Neural Network)은 사람 뇌의 뉴런이 신호를 주고받는 방식을 수학적으로 본뜬 구조로, 모든 딥러닝의 기본 뼈대입니다. 뉴런 하나의 동작 인공 뉴런은 여러 입력값에 각각 가중치(weight)를 곱해 더하고, 여기에 편향(bias)을 보탠 뒤, 활성화 함수를 거쳐 출력을 냅니다. 활성화 함수는 신호를 얼마나 다음 층으로 전달할지 결정하는 문지기 … 더 읽기

딥러닝의 역사 — 퍼셉트론에서 트랜스포머까지

📘 코딩이란? 강좌 · 3-2단원 — 인공지능/머신러닝/딥러닝 입문 시리즈 딥러닝의 역사 딥러닝의 뿌리는 60년도 더 거슬러 올라갑니다. 여러 번의 좌절과 돌파를 거쳐 오늘의 모습에 이르렀습니다. 퍼셉트론의 등장과 한계 — 1950~1960년대 1958년 프랭크 로젠블랫이 뇌의 뉴런을 본뜬 퍼셉트론을 제안했습니다. 하지만 1969년 단층 퍼셉트론이 XOR처럼 단순한 문제조차 풀지 못한다는 한계가 지적되며 연구가 크게 위축되었습니다. 역전파의 재발견 — … 더 읽기