반응형 전체 글682 R-CNN에서 Faster R-CNN까지: 2-stage 탐지기의 계보 AI/ML 엔지니어링 · 컴퓨터 비전 R-CNN에서 Faster R-CNN까지: 2-stage 탐지기의 계보 "영역을 먼저 제안하고, 그 다음 분류한다." 정확도를 앞세운 2-stage 객체 탐지의 발전 과정을 단계별로 따라갑니다. YOLO가 속도를 대표한다면, R-CNN 계열은 정확도를 대표합니다. 이 계열의 발전사는 "어떻게 영역 제안과 분류를 더 빠르고 정교하게 결합할 것인가"라는 한 가지 질문에 대한 연속된 답이었습니다. R-CNN (2014): 첫걸음 원조 R-CNN의 절차는 직관적입니다. 먼저 Selective Search라는 비신경망 알고리즘으로 객체 후보 영역 약 2,000개를 뽑고, 각 영역을 잘라내 CNN에 통과시켜 특징을 추출한 뒤 SVM으로 .. 2026. 10. 3. YOLO: 한 번의 추론으로 모든 객체를 찾는다 AI/ML 엔지니어링 · 컴퓨터 비전 YOLO: 한 번의 추론으로 모든 객체를 찾는다 "You Only Look Once" — 이미지를 단 한 번만 보고 객체의 위치와 종류를 동시에 예측하는 실시간 객체 탐지의 대명사. 그 설계 철학과 진화를 풀어봅니다. 객체 탐지(object detection)는 이미지 안의 모든 객체에 대해 "무엇인지(분류)"와 "어디에 있는지(바운딩 박스)"를 동시에 답하는 과제입니다. YOLO는 이 문제를 단일 회귀 문제로 재정의하며 실시간 탐지의 시대를 열었습니다. 1-stage vs 2-stage 탐지기는 크게 두 계열로 나뉩니다. R-CNN 계열의 2-stage 탐지기는 먼저 객체가 있을 법한 영역(region proposal)을 추.. 2026. 10. 3. 이미지 분류(Image Classification): 컴퓨터 비전의 출발점 AI/ML 엔지니어링 · 컴퓨터 비전 이미지 분류(Image Classification): 컴퓨터 비전의 출발점 한 장의 이미지를 보고 "이것은 무엇인가"를 답하는 가장 기본적인 비전 과제. 그 원리와 핵심 아키텍처, 그리고 실무 학습 전략까지 정리합니다. 이미지 분류는 입력 이미지 전체를 하나의 클래스 레이블로 매핑하는 작업입니다. "이 사진은 고양이인가 개인가"처럼 단일 정답을 출력하며, 객체 탐지·분할 등 더 복잡한 비전 과제의 토대가 됩니다. 딥러닝이 컴퓨터 비전을 지배하게 된 출발점도 바로 이 분류 문제였습니다. 왜 CNN인가 일반 완전연결 신경망은 이미지의 픽셀을 1차원으로 펼쳐 처리하기 때문에 공간 구조가 무너지고 파라미터가 폭발합니다. 합성곱 신경망.. 2026. 10. 3. 감성 분석(Sentiment Analysis): 텍스트에 담긴 감정을 읽다 NLP · Task 감성 분석(Sentiment Analysis): 텍스트에 담긴 감정을 읽다 리뷰가 칭찬인가 불만인가. 대량의 의견 데이터에서 사람의 태도를 자동으로 가늠하는 의견 마이닝의 핵심.감성 분석은 텍스트에 드러난 글쓴이의 감정·태도·의견의 극성(긍정/부정/중립)을 판별하는 과제다. 상품 리뷰, 소셜 미디어 게시물, 고객 상담 기록처럼 쏟아지는 의견 데이터를 사람이 일일이 읽을 수 없으므로, 이를 자동으로 요약하는 의견 마이닝의 출발점이 된다.분석의 세분화 수준 수준대상예시 질문 문서 단위글 전체이 리뷰는 전반적으로 긍정인가? 문장 단위개별 문장이 문장은 어떤 극성인가? 속성 단위특정 측면'배터리'에 대한 감정은?특히 속성 기반 감성 분석(ABSA)은 "화면은 좋은데 배터리가 아쉽다.. 2026. 10. 2. 개체명 인식(NER): 텍스트에서 의미 있는 이름을 찾아내기 NLP · Task 개체명 인식(NER): 텍스트에서 의미 있는 이름을 찾아내기 "이순신은 1545년 한산도에서…" 같은 문장에서 사람·날짜·장소를 자동으로 짚어내는 정보 추출의 기본기.개체명 인식(Named Entity Recognition)은 텍스트에서 사람·기관·장소·날짜·금액 같은 고유한 의미를 가진 표현을 찾아 미리 정한 범주로 분류하는 과제다. 검색, 질의응답, 문서 자동 분류, 챗봇의 의도 파악 등 수많은 응용의 전처리 단계로 쓰이는 정보 추출의 핵심 기술이다.무엇을 인식하는가 범주예시 PER (인물)이순신, 세종대왕 ORG (기관)삼성전자, 서울대학교 LOC (장소)부산, 한산도 DAT (날짜)1545년, 어제시퀀스 라벨링으로서의 NERNER은 본질적으로 각 토큰에 라벨을 붙이.. 2026. 10. 2. Hugging Face: NLP 생태계를 하나로 묶는 허브 NLP · Ecosystem Hugging Face: NLP 생태계를 하나로 묶는 허브 모델 한 줄로 불러오고, 데이터셋 한 줄로 가져오고, 앱 하나로 배포한다. 현대 NLP 개발의 공용어가 된 플랫폼.아무리 뛰어난 모델이라도 불러오고, 미세조정하고, 배포하는 과정이 제각각이라면 활용이 어렵다. Hugging Face는 수많은 사전 학습 모델을 일관된 인터페이스로 다루게 해 주는 라이브러리와 플랫폼을 제공하며, 오늘날 NLP 실무의 사실상 표준 도구가 되었다.핵심 라이브러리transformersBERT, GPT, T5, LLaMA 등 수많은 아키텍처를 동일한 API로 불러오고 사용할 수 있게 하는 중심 라이브러리다. AutoModel, AutoTokenizer 계열 클래스가 모델 이름만으로 알맞은 구.. 2026. 10. 1. LLaMA: 오픈 웨이트 대규모 언어 모델의 표준 NLP · Open Models LLaMA: 오픈 웨이트 대규모 언어 모델의 표준 가중치를 공개하는 것만으로 생태계 하나를 만들 수 있다. 자체 호스팅 가능한 LLM의 사실상 기준이 된 모델 계열.LLaMA(Large Language Model Meta AI)는 메타가 2023년 2월부터 공개해 온 오픈 웨이트 대규모 언어 모델 계열이다. GPT처럼 디코더 단독 구조의 자기회귀 모델이지만, 결정적 차이는 모델 가중치를 내려받아 자체 인프라에서 직접 돌릴 수 있다는 점이다. 이 개방성 덕분에 LLaMA는 연구·기업·개인 개발자가 미세조정하고 배포하는 사실상의 표준 기반 모델로 자리 잡았다.왜 LLaMA가 중요한가API로만 접근 가능한 폐쇄 모델과 달리, 가중치가 공개되면 데이터를 외부로 보내지 않고 온.. 2026. 9. 30. T5와 BART: 인코더-디코더로 모든 과제를 텍스트로 NLP · Transformer T5와 BART: 인코더-디코더로 모든 과제를 텍스트로 번역도, 요약도, 분류도 전부 "텍스트 입력 → 텍스트 출력". 통합된 프레임으로 NLP를 다시 정의하다.BERT는 인코더만, GPT는 디코더만 사용한다. T5와 BART는 둘을 모두 갖춘 인코더-디코더(seq2seq) 구조다. 인코더가 입력 전체를 양방향으로 이해하고, 디코더가 그 이해를 바탕으로 새 텍스트를 자기회귀적으로 생성한다. 이해와 생성을 한 모델 안에서 결합하므로 번역·요약처럼 입력을 변환해 출력하는 과제에 자연스럽게 맞는다.T5: 모든 것을 Text-to-Text로구글의 T5(Text-to-Text Transfer Transformer)는 과감한 통일을 시도했다. 분류든 번역이든 요약이든, 모든 NL.. 2026. 9. 29. GPT: 다음 단어를 예측하며 세상을 학습한 디코더 NLP · Transformer GPT: 다음 단어를 예측하며 세상을 학습한 디코더 "다음에 올 단어를 맞혀라"는 단순한 목표가, 어떻게 글쓰기·번역·추론을 모두 해내는 모델로 이어졌는가.GPT(Generative Pre-trained Transformer)는 OpenAI가 발표한 모델 계열로, 트랜스포머의 디코더를 쌓아 만든다. BERT가 문맥을 양방향으로 읽는 '이해' 모델이라면, GPT는 왼쪽에서 오른쪽으로 다음 토큰을 하나씩 예측하는 자기회귀(autoregressive) '생성' 모델이다.인과적 어텐션GPT의 핵심은 마스크드 셀프 어텐션이다. 각 토큰은 자신보다 앞에 있는 토큰만 참조할 수 있고, 뒤쪽은 마스킹되어 볼 수 없다. 미래를 미리 엿보지 못하게 막는 이 제약 덕분에, 모델은 "지금까.. 2026. 9. 28. BERT: 양방향 문맥으로 언어를 이해하는 인코더 NLP · Transformer BERT: 양방향 문맥으로 언어를 이해하는 인코더 2018년, 한 단어를 양쪽 문맥 모두로 해석하기 시작하면서 자연어 이해의 판도가 바뀌었다.BERT(Bidirectional Encoder Representations from Transformers)는 구글이 2018년에 발표한 모델로, 트랜스포머의 인코더만을 쌓아 만든 구조다. 이전의 정적 임베딩이나 단방향 언어 모델과 달리, BERT는 문장의 왼쪽과 오른쪽 문맥을 동시에 보면서 각 토큰의 의미를 해석한다. 그 결과 같은 단어라도 문장에 따라 다른 벡터를 얻는 문맥적 임베딩이 가능해졌다.왜 '양방향'이 중요한가"통장에서 돈을 찾다"와 "잃어버린 열쇠를 찾다"에서 '찾다'의 의미는 다르다. 단방향 모델은 앞쪽 단어만 .. 2026. 9. 28. 단어 임베딩: Word2Vec와 GloVe로 의미를 벡터에 담다 NLP · Representation 단어 임베딩: Word2Vec와 GloVe로 의미를 벡터에 담다 "왕 − 남자 + 여자 = 여왕"이 수식으로 성립하는 세계. 단어를 좌표 공간 위의 점으로 바꾸는 기술의 출발점.토큰을 정수 ID로 바꾸는 것만으로는 부족하다. ID는 그저 임의의 번호여서 고양이(42)와 강아지(43)가 의미상 가깝다는 사실을 전혀 담지 못한다. 임베딩은 각 단어를 수백 차원의 실수 벡터로 매핑해, 의미가 비슷한 단어가 공간상에서도 가까이 놓이도록 만든다. 그 바탕에는 분포 가설, 즉 "비슷한 문맥에 나타나는 단어는 비슷한 의미를 가진다"는 통찰이 있다.Word2Vec: 예측 기반 학습2013년 구글이 제안한 Word2Vec은 신경망으로 단어 벡터를 학습하는 두 가지 구조를 제시했다.. 2026. 9. 27. 토큰화(Tokenization): 텍스트를 모델이 읽는 단위로 쪼개기 NLP · Foundations 토큰화(Tokenization): 텍스트를 모델이 읽는 단위로 쪼개기 모든 자연어 처리 파이프라인의 첫 관문. 문장을 어떤 단위로 나누느냐가 이후 모델 성능 전체를 좌우한다.컴퓨터는 문자열을 그대로 이해하지 못한다. 텍스트를 모델이 다룰 수 있는 이산적인 단위, 즉 토큰(token)으로 분해하는 과정이 토큰화다. 토큰은 단어일 수도, 부분 단어(subword)일 수도, 심지어 개별 문자나 바이트일 수도 있다. 어떤 단위를 선택하느냐에 따라 어휘 사전(vocabulary)의 크기, 미등록 단어(OOV) 처리 방식, 시퀀스 길이가 모두 달라진다.토큰화의 세 가지 접근1. 단어 단위(Word-level)공백과 구두점을 기준으로 단어를 나누는 가장 직관적인 방식이다. 영어처럼.. 2026. 9. 27. 기술 다이어그램 (Mermaid, PlantUML) — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 기술 다이어그램: 코드로 그리는 그림 (Mermaid & PlantUML) 드래그로 그린 다이어그램은 코드가 바뀌면 거짓말이 된다. 텍스트로 다이어그램을 정의하는 Diagrams-as-Code 방식으로, 버전 관리되고 항상 최신인 시각 자료를 만드는 방법을 정리한다. Mermaid PlantUML Diagrams-as-Code Visualization 테크니컬 라이팅 시리즈·6 / 6Visio나 draw.io로 공들여 그린 아키텍처 다이어그램이 6개월 만에 현실과 동떨어지는 이유는 단순하다. 코드와 따로 놀기 때문이다. Diagrams-as-Code는 다이어그램을 텍스트로 정의해 코드 곁에 두고, Git으로 버전 관리하며, 리뷰를 거치게.. 2026. 9. 27. CHANGELOG 관리 — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 CHANGELOG 관리: 사용자를 위한 변경 기록의 기술 git log는 개발자의 기록이고, CHANGELOG는 사용자의 기록이다. Keep a Changelog 표준과 시맨틱 버저닝을 토대로, 사람이 읽을 수 있는 변경 이력을 유지하는 방법을 정리한다. CHANGELOG SemVer Release Notes Versioning 테크니컬 라이팅 시리즈·5 / 6"v2.3.0으로 업데이트해도 안전한가? 뭐가 바뀌었지?" 사용자의 이 질문에 답하는 것이 CHANGELOG다. 커밋 로그를 그대로 붙여넣는 것은 답이 아니다. CHANGELOG는 기계가 아니라 사람을 위해, 변경의 영향을 중심으로 쓰여야 한다.01왜 git log로 충분하지 않은.. 2026. 9. 26. README 작성 가이드 — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 README 작성 가이드: 프로젝트의 첫인상이자 명함 README는 방문자가 가장 먼저 읽는 문서이자, 종종 유일하게 읽는 문서다. 30초 안에 "이게 무엇이고 나에게 쓸모 있는가"를 전달하는 README 구조를 정리한다. README Open Source Onboarding Markdown 테크니컬 라이팅 시리즈·4 / 6깃허브 저장소에 들어온 사람이 별을 누를지, 그냥 떠날지는 대부분 README의 첫 화면에서 결정된다. 아무리 뛰어난 코드라도 README가 부실하면 아무도 쓰지 않는다. README는 코드의 포장지가 아니라 진입로다.01README가 답해야 할 세 가지 질문방문자는 무의식적으로 세 가지를 묻는다. 좋은 README는.. 2026. 9. 26. RFC 작성법 — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 RFC 작성법: 코드를 짜기 전에 합의를 설계하라 큰 변경일수록 코드보다 먼저 글로 합의해야 한다. RFC(Request for Comments)로 설계 의도를 공유하고, 비동기적으로 피드백을 모아 더 나은 결정을 내리는 프로세스를 정리한다. RFC Design Doc Async Collaboration Decision Making 테크니컬 라이팅 시리즈·3 / 6기능을 절반쯤 구현한 뒤에야 "이 접근 방식에 근본적인 문제가 있다"는 것을 깨달은 경험이 있다면, RFC가 필요한 순간을 이미 겪은 것이다. RFC는 키보드를 두드리기 전에 가장 값싼 매체인 글로 설계를 검증하는 협업 도구다.01RFC란 무엇이며 언제 쓰는가RFC는 인터넷 표.. 2026. 9. 26. ADR (아키텍처 결정 기록) — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 ADR: "왜 이렇게 결정했더라?"를 영원히 기록하는 법 코드는 "무엇을" 했는지 보여주지만, "왜" 그렇게 했는지는 사라진다. 아키텍처 결정 기록(ADR)으로 결정의 맥락과 트레이드오프를 미래의 팀에게 남기는 방법을 정리한다. ADR Architecture Decision Records Documentation 테크니컬 라이팅 시리즈·2 / 66개월 뒤 누군가 코드를 보며 "왜 여기서 Kafka를 안 쓰고 RabbitMQ를 썼지?"라고 묻는다. 당시 회의에 있던 사람은 퇴사했고, 슬랙 스레드는 검색되지 않는다. ADR(Architecture Decision Record)은 바로 이 "잃어버린 맥락" 문제를 해결하기 위한 가볍고 강력한 .. 2026. 9. 25. API 문서 작성 — 테크니컬 라이팅 IT 특수분야 · 테크니컬 라이팅 API 문서 작성: 개발자가 5분 안에 첫 호출에 성공하게 만들기 좋은 API 문서는 마케팅 자료가 아니라 사용 설명서다. 레퍼런스, 가이드, 튜토리얼의 역할을 구분하고 OpenAPI를 중심으로 유지보수 가능한 문서 체계를 설계하는 방법을 정리한다. OpenAPI REST Developer Experience Docs-as-Code 테크니컬 라이팅 시리즈·1 / 6API 문서의 품질은 채택률(adoption)에 직접적인 영향을 미친다. 개발자는 평균 몇 분 안에 첫 성공적인 호출(time-to-first-call)을 경험하지 못하면 다른 대안을 찾기 시작한다. 문서가 곧 제품의 첫인상이라는 전제에서 시작해야 한다.01레퍼런스 · 가이드 .. 2026. 9. 25. 이전 1 2 3 4 ··· 38 다음 반응형