반응형 전체 글687 얼굴 인식(Face Recognition): 검출에서 신원 확인까지 AI/ML 엔지니어링 · 컴퓨터 비전 얼굴 인식(Face Recognition): 검출에서 신원 확인까지 얼굴을 찾고, 특징을 벡터로 바꾸고, 거리로 동일인을 판단한다. 임베딩 기반 얼굴 인식의 원리와 책임 있는 활용을 함께 다룹니다. 얼굴 인식은 이미지 속 얼굴이 "누구인가"를 판별하는 기술입니다. 흔히 한 단어로 묶이지만 실제로는 여러 단계로 나뉘며, 각 단계가 서로 다른 비전 기술을 동원합니다. 얼굴 인식의 4단계 ① 얼굴 검출(Detection): 이미지에서 얼굴의 위치를 찾습니다. ② 정렬(Alignment): 눈·코·입 같은 랜드마크를 기준으로 얼굴을 표준 위치·각도로 보정합니다. ③ 임베딩(Embedding): 얼굴을 고정.. 2026. 10. 6. OpenCV: 컴퓨터 비전의 만능 공구함 AI/ML 엔지니어링 · 컴퓨터 비전 OpenCV: 컴퓨터 비전의 만능 공구함 딥러닝 이전부터 지금까지, 모든 비전 프로젝트의 토대가 되는 라이브러리. 핵심 기능과 실전 활용 패턴을 짚어봅니다. OpenCV(Open Source Computer Vision Library)는 2000년대 초부터 이어져 온 비전 분야의 표준 라이브러리입니다. C++로 작성되었지만 파이썬 바인딩이 잘 갖춰져 있어, 이미지 입출력부터 전처리·기하 변환·특징 검출·영상 처리까지 비전 작업의 거의 모든 기초를 담당합니다. 딥러닝 모델의 입력 전처리와 출력 후처리 양쪽에서 사실상 필수 도구입니다. 이미지는 NumPy 배열이다 OpenCV에서 이미지는 NumPy 배열로 표현됩니다. 컬러 이미지.. 2026. 10. 5. OCR: 이미지 속 글자를 텍스트로 되살리기 AI/ML 엔지니어링 · 컴퓨터 비전 OCR: 이미지 속 글자를 텍스트로 되살리기 광학 문자 인식의 두 단계 — 글자를 찾고(detection), 읽는다(recognition). 전통 기법부터 딥러닝 기반 엔드투엔드 파이프라인까지 정리합니다. OCR(Optical Character Recognition)은 이미지나 스캔 문서, 사진 속 글자를 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다. 종이 문서의 디지털화부터 번역 앱의 실시간 텍스트 인식, 자동차 번호판 판독까지 폭넓게 쓰입니다. OCR의 두 단계 현대 OCR 파이프라인은 두 단계로 구성됩니다. 텍스트 검출(Text Detection): 이미지에서 글자가 있는 영역의 위치(박스 또는 다각.. 2026. 10. 5. 포즈 추정(Pose Estimation): 몸의 움직임을 읽는 기술 AI/ML 엔지니어링 · 컴퓨터 비전 포즈 추정(Pose Estimation): 몸의 움직임을 읽는 기술 관절의 좌표를 찾아 사람의 자세와 동작을 구조화한다. 키포인트 검출의 원리부터 톱다운·보텀업 접근, 그리고 실무 라이브러리까지. 포즈 추정은 이미지나 영상 속 사람(또는 객체)의 주요 관절 위치, 즉 키포인트(keypoint)를 찾아내는 과제입니다. 어깨·팔꿈치·손목·무릎 같은 점들을 검출하고 이들을 연결해 골격(skeleton)을 구성함으로써, 픽셀 더미였던 사람을 동작을 분석할 수 있는 구조적 데이터로 바꿉니다. 무엇을 출력하는가 대표 데이터셋 COCO 기준으로 사람당 17개의 키포인트(코, 양 눈·귀, 양 어깨·팔꿈치·손목·엉덩이·무릎·발목)를 예측합니다.. 2026. 10. 4. 이미지 분할(Segmentation): 픽셀 단위로 세상을 이해하기 AI/ML 엔지니어링 · 컴퓨터 비전 이미지 분할(Segmentation): 픽셀 단위로 세상을 이해하기 바운딩 박스를 넘어, 모든 픽셀에 의미를 부여하는 가장 정밀한 비전 과제. 시맨틱·인스턴스·판옵틱 분할의 차이와 대표 모델을 정리합니다. 분류가 "이 사진은 무엇인가"를, 탐지가 "객체가 어디 있는가"를 답한다면, 분할은 "각 픽셀이 무엇에 속하는가"를 답합니다. 이미지의 모든 픽셀에 클래스 레이블을 부여하는 가장 조밀한 예측 과제입니다. 세 가지 분할 유형 유형구분 기준예시 시맨틱 분할같은 클래스는 하나로 묶음모든 사람을 '사람' 영역으로 인스턴스 분할같은 클래스도 개체별 구분사람1, 사.. 2026. 10. 4. R-CNN에서 Faster R-CNN까지: 2-stage 탐지기의 계보 AI/ML 엔지니어링 · 컴퓨터 비전 R-CNN에서 Faster R-CNN까지: 2-stage 탐지기의 계보 "영역을 먼저 제안하고, 그 다음 분류한다." 정확도를 앞세운 2-stage 객체 탐지의 발전 과정을 단계별로 따라갑니다. YOLO가 속도를 대표한다면, R-CNN 계열은 정확도를 대표합니다. 이 계열의 발전사는 "어떻게 영역 제안과 분류를 더 빠르고 정교하게 결합할 것인가"라는 한 가지 질문에 대한 연속된 답이었습니다. R-CNN (2014): 첫걸음 원조 R-CNN의 절차는 직관적입니다. 먼저 Selective Search라는 비신경망 알고리즘으로 객체 후보 영역 약 2,000개를 뽑고, 각 영역을 잘라내 CNN에 통과시켜 특징을 추출한 뒤 SVM으로 .. 2026. 10. 3. YOLO: 한 번의 추론으로 모든 객체를 찾는다 AI/ML 엔지니어링 · 컴퓨터 비전 YOLO: 한 번의 추론으로 모든 객체를 찾는다 "You Only Look Once" — 이미지를 단 한 번만 보고 객체의 위치와 종류를 동시에 예측하는 실시간 객체 탐지의 대명사. 그 설계 철학과 진화를 풀어봅니다. 객체 탐지(object detection)는 이미지 안의 모든 객체에 대해 "무엇인지(분류)"와 "어디에 있는지(바운딩 박스)"를 동시에 답하는 과제입니다. YOLO는 이 문제를 단일 회귀 문제로 재정의하며 실시간 탐지의 시대를 열었습니다. 1-stage vs 2-stage 탐지기는 크게 두 계열로 나뉩니다. R-CNN 계열의 2-stage 탐지기는 먼저 객체가 있을 법한 영역(region proposal)을 추.. 2026. 10. 3. 이미지 분류(Image Classification): 컴퓨터 비전의 출발점 AI/ML 엔지니어링 · 컴퓨터 비전 이미지 분류(Image Classification): 컴퓨터 비전의 출발점 한 장의 이미지를 보고 "이것은 무엇인가"를 답하는 가장 기본적인 비전 과제. 그 원리와 핵심 아키텍처, 그리고 실무 학습 전략까지 정리합니다. 이미지 분류는 입력 이미지 전체를 하나의 클래스 레이블로 매핑하는 작업입니다. "이 사진은 고양이인가 개인가"처럼 단일 정답을 출력하며, 객체 탐지·분할 등 더 복잡한 비전 과제의 토대가 됩니다. 딥러닝이 컴퓨터 비전을 지배하게 된 출발점도 바로 이 분류 문제였습니다. 왜 CNN인가 일반 완전연결 신경망은 이미지의 픽셀을 1차원으로 펼쳐 처리하기 때문에 공간 구조가 무너지고 파라미터가 폭발합니다. 합성곱 신경망.. 2026. 10. 3. 감성 분석(Sentiment Analysis): 텍스트에 담긴 감정을 읽다 NLP · Task 감성 분석(Sentiment Analysis): 텍스트에 담긴 감정을 읽다 리뷰가 칭찬인가 불만인가. 대량의 의견 데이터에서 사람의 태도를 자동으로 가늠하는 의견 마이닝의 핵심.감성 분석은 텍스트에 드러난 글쓴이의 감정·태도·의견의 극성(긍정/부정/중립)을 판별하는 과제다. 상품 리뷰, 소셜 미디어 게시물, 고객 상담 기록처럼 쏟아지는 의견 데이터를 사람이 일일이 읽을 수 없으므로, 이를 자동으로 요약하는 의견 마이닝의 출발점이 된다.분석의 세분화 수준 수준대상예시 질문 문서 단위글 전체이 리뷰는 전반적으로 긍정인가? 문장 단위개별 문장이 문장은 어떤 극성인가? 속성 단위특정 측면'배터리'에 대한 감정은?특히 속성 기반 감성 분석(ABSA)은 "화면은 좋은데 배터리가 아쉽다.. 2026. 10. 2. 개체명 인식(NER): 텍스트에서 의미 있는 이름을 찾아내기 NLP · Task 개체명 인식(NER): 텍스트에서 의미 있는 이름을 찾아내기 "이순신은 1545년 한산도에서…" 같은 문장에서 사람·날짜·장소를 자동으로 짚어내는 정보 추출의 기본기.개체명 인식(Named Entity Recognition)은 텍스트에서 사람·기관·장소·날짜·금액 같은 고유한 의미를 가진 표현을 찾아 미리 정한 범주로 분류하는 과제다. 검색, 질의응답, 문서 자동 분류, 챗봇의 의도 파악 등 수많은 응용의 전처리 단계로 쓰이는 정보 추출의 핵심 기술이다.무엇을 인식하는가 범주예시 PER (인물)이순신, 세종대왕 ORG (기관)삼성전자, 서울대학교 LOC (장소)부산, 한산도 DAT (날짜)1545년, 어제시퀀스 라벨링으로서의 NERNER은 본질적으로 각 토큰에 라벨을 붙이.. 2026. 10. 2. Hugging Face: NLP 생태계를 하나로 묶는 허브 NLP · Ecosystem Hugging Face: NLP 생태계를 하나로 묶는 허브 모델 한 줄로 불러오고, 데이터셋 한 줄로 가져오고, 앱 하나로 배포한다. 현대 NLP 개발의 공용어가 된 플랫폼.아무리 뛰어난 모델이라도 불러오고, 미세조정하고, 배포하는 과정이 제각각이라면 활용이 어렵다. Hugging Face는 수많은 사전 학습 모델을 일관된 인터페이스로 다루게 해 주는 라이브러리와 플랫폼을 제공하며, 오늘날 NLP 실무의 사실상 표준 도구가 되었다.핵심 라이브러리transformersBERT, GPT, T5, LLaMA 등 수많은 아키텍처를 동일한 API로 불러오고 사용할 수 있게 하는 중심 라이브러리다. AutoModel, AutoTokenizer 계열 클래스가 모델 이름만으로 알맞은 구.. 2026. 10. 1. LLaMA: 오픈 웨이트 대규모 언어 모델의 표준 NLP · Open Models LLaMA: 오픈 웨이트 대규모 언어 모델의 표준 가중치를 공개하는 것만으로 생태계 하나를 만들 수 있다. 자체 호스팅 가능한 LLM의 사실상 기준이 된 모델 계열.LLaMA(Large Language Model Meta AI)는 메타가 2023년 2월부터 공개해 온 오픈 웨이트 대규모 언어 모델 계열이다. GPT처럼 디코더 단독 구조의 자기회귀 모델이지만, 결정적 차이는 모델 가중치를 내려받아 자체 인프라에서 직접 돌릴 수 있다는 점이다. 이 개방성 덕분에 LLaMA는 연구·기업·개인 개발자가 미세조정하고 배포하는 사실상의 표준 기반 모델로 자리 잡았다.왜 LLaMA가 중요한가API로만 접근 가능한 폐쇄 모델과 달리, 가중치가 공개되면 데이터를 외부로 보내지 않고 온.. 2026. 9. 30. T5와 BART: 인코더-디코더로 모든 과제를 텍스트로 NLP · Transformer T5와 BART: 인코더-디코더로 모든 과제를 텍스트로 번역도, 요약도, 분류도 전부 "텍스트 입력 → 텍스트 출력". 통합된 프레임으로 NLP를 다시 정의하다.BERT는 인코더만, GPT는 디코더만 사용한다. T5와 BART는 둘을 모두 갖춘 인코더-디코더(seq2seq) 구조다. 인코더가 입력 전체를 양방향으로 이해하고, 디코더가 그 이해를 바탕으로 새 텍스트를 자기회귀적으로 생성한다. 이해와 생성을 한 모델 안에서 결합하므로 번역·요약처럼 입력을 변환해 출력하는 과제에 자연스럽게 맞는다.T5: 모든 것을 Text-to-Text로구글의 T5(Text-to-Text Transfer Transformer)는 과감한 통일을 시도했다. 분류든 번역이든 요약이든, 모든 NL.. 2026. 9. 29. GPT: 다음 단어를 예측하며 세상을 학습한 디코더 NLP · Transformer GPT: 다음 단어를 예측하며 세상을 학습한 디코더 "다음에 올 단어를 맞혀라"는 단순한 목표가, 어떻게 글쓰기·번역·추론을 모두 해내는 모델로 이어졌는가.GPT(Generative Pre-trained Transformer)는 OpenAI가 발표한 모델 계열로, 트랜스포머의 디코더를 쌓아 만든다. BERT가 문맥을 양방향으로 읽는 '이해' 모델이라면, GPT는 왼쪽에서 오른쪽으로 다음 토큰을 하나씩 예측하는 자기회귀(autoregressive) '생성' 모델이다.인과적 어텐션GPT의 핵심은 마스크드 셀프 어텐션이다. 각 토큰은 자신보다 앞에 있는 토큰만 참조할 수 있고, 뒤쪽은 마스킹되어 볼 수 없다. 미래를 미리 엿보지 못하게 막는 이 제약 덕분에, 모델은 "지금까.. 2026. 9. 28. BERT: 양방향 문맥으로 언어를 이해하는 인코더 NLP · Transformer BERT: 양방향 문맥으로 언어를 이해하는 인코더 2018년, 한 단어를 양쪽 문맥 모두로 해석하기 시작하면서 자연어 이해의 판도가 바뀌었다.BERT(Bidirectional Encoder Representations from Transformers)는 구글이 2018년에 발표한 모델로, 트랜스포머의 인코더만을 쌓아 만든 구조다. 이전의 정적 임베딩이나 단방향 언어 모델과 달리, BERT는 문장의 왼쪽과 오른쪽 문맥을 동시에 보면서 각 토큰의 의미를 해석한다. 그 결과 같은 단어라도 문장에 따라 다른 벡터를 얻는 문맥적 임베딩이 가능해졌다.왜 '양방향'이 중요한가"통장에서 돈을 찾다"와 "잃어버린 열쇠를 찾다"에서 '찾다'의 의미는 다르다. 단방향 모델은 앞쪽 단어만 .. 2026. 9. 28. 단어 임베딩: Word2Vec와 GloVe로 의미를 벡터에 담다 NLP · Representation 단어 임베딩: Word2Vec와 GloVe로 의미를 벡터에 담다 "왕 − 남자 + 여자 = 여왕"이 수식으로 성립하는 세계. 단어를 좌표 공간 위의 점으로 바꾸는 기술의 출발점.토큰을 정수 ID로 바꾸는 것만으로는 부족하다. ID는 그저 임의의 번호여서 고양이(42)와 강아지(43)가 의미상 가깝다는 사실을 전혀 담지 못한다. 임베딩은 각 단어를 수백 차원의 실수 벡터로 매핑해, 의미가 비슷한 단어가 공간상에서도 가까이 놓이도록 만든다. 그 바탕에는 분포 가설, 즉 "비슷한 문맥에 나타나는 단어는 비슷한 의미를 가진다"는 통찰이 있다.Word2Vec: 예측 기반 학습2013년 구글이 제안한 Word2Vec은 신경망으로 단어 벡터를 학습하는 두 가지 구조를 제시했다.. 2026. 9. 27. 토큰화(Tokenization): 텍스트를 모델이 읽는 단위로 쪼개기 NLP · Foundations 토큰화(Tokenization): 텍스트를 모델이 읽는 단위로 쪼개기 모든 자연어 처리 파이프라인의 첫 관문. 문장을 어떤 단위로 나누느냐가 이후 모델 성능 전체를 좌우한다.컴퓨터는 문자열을 그대로 이해하지 못한다. 텍스트를 모델이 다룰 수 있는 이산적인 단위, 즉 토큰(token)으로 분해하는 과정이 토큰화다. 토큰은 단어일 수도, 부분 단어(subword)일 수도, 심지어 개별 문자나 바이트일 수도 있다. 어떤 단위를 선택하느냐에 따라 어휘 사전(vocabulary)의 크기, 미등록 단어(OOV) 처리 방식, 시퀀스 길이가 모두 달라진다.토큰화의 세 가지 접근1. 단어 단위(Word-level)공백과 구두점을 기준으로 단어를 나누는 가장 직관적인 방식이다. 영어처럼.. 2026. 9. 27. 기술 다이어그램 (Mermaid, PlantUML) — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 기술 다이어그램: 코드로 그리는 그림 (Mermaid & PlantUML) 드래그로 그린 다이어그램은 코드가 바뀌면 거짓말이 된다. 텍스트로 다이어그램을 정의하는 Diagrams-as-Code 방식으로, 버전 관리되고 항상 최신인 시각 자료를 만드는 방법을 정리한다. Mermaid PlantUML Diagrams-as-Code Visualization 테크니컬 라이팅 시리즈·6 / 6Visio나 draw.io로 공들여 그린 아키텍처 다이어그램이 6개월 만에 현실과 동떨어지는 이유는 단순하다. 코드와 따로 놀기 때문이다. Diagrams-as-Code는 다이어그램을 텍스트로 정의해 코드 곁에 두고, Git으로 버전 관리하며, 리뷰를 거치게.. 2026. 9. 27. 이전 1 2 3 4 ··· 39 다음 반응형