로컬 AI와 LLM을 직접 만드는 기록
RSS Feed개발자 박성열입니다. 한국어 토크나이저와 소형 언어 모델, 온디바이스 AI를 직접 만들고 있습니다. 결과만 정리하기보다 어떤 가설을 세웠고, 어디서 틀렸으며, 무엇을 다시 확인했는지까지 기록합니다.
머신러닝 기초부터 한국어 LLM 실험과 공개 모델 개발기까지 차근차근 쌓아가고 있습니다. 궁금한 점이나 제안할 내용이 있다면 언제든 psymon.dev@gmail.com 으로 편하게 연락 주세요.
Featured
-
Mistral-7B ARC-Challenge - 모델 오답으로 다시 학습하기
약 16분 읽기Mistral-7B에 과학 QA를 SFT한 뒤 모델이 높은 점수를 준 오답을 preference 학습에 활용했다. 높은 점수를 얻은 뒤 대조 실험과 재현성을 다시 검증한 기록.
-
Hugging Face Seoul Meetup 세션 정리
약 16분 읽기Hugging Face Seoul Meetup에서 나온 오픈소스 AI, 한국어 평가셋, 형태소 분석기, 도메인 AI, 한국어 언어모델 발표를 세션별로 정리했다.
-
Solar-Open2와 한국어 토크나이저 분석
약 19분 읽기Solar-Open2를 확인하다가 다시 마주친 한국어 토크나이저 이슈. 법인세효과가라는 작은 토큰을 따라가며, BPE merge와 도메인 코퍼스 비율, long-tail token이 모델 동작에 줄 수 있는 영향을 검토한다.
-
Tiny-Ko-Stories - 한국어다운 데이터가 작은 모델을 바꿀 수 있을까
약 21분 읽기번역 데이터가 아닌 한국어 이야기 200만 편을 만들고, 35M 소형 언어 모델로 데이터 품질의 힘을 확인해 본 실험 기록.
-
한국어 토크나이저 실험기 3 - 토큰 수를 줄이면 모델도 좋아질까
약 21분 읽기한국어 토크나이저 실험 세 번째 기록. TPW가 낮으면 실제 언어 모델도 좋아지는지 확인하기 위해, WS와 C100을 직접 학습해 보고 BPB가 어디서 뒤집히는지 추적했다.
-
한국어 토크나이저 실험기 2 - 공백의 의미
약 19분 읽기한국어 토크나이저 실험 두 번째 기록. 형태소 가설 이후 regex와 공백 처리를 하나씩 바꿔 보며, TPW 기준으로 가장 강하게 남은 변수가 무엇이었는지 정리한다.
-
5. 분류 II - 판별 분석과 베이즈 분류기
약 31분 읽기베이즈 정리로 분류 문제를 바라본다. 조건부 확률에서 출발해 QDA, LDA, 나이브 베이즈의 수식을 단계별로 풀고, 정확도만으로는 부족한 분류 평가 지표까지 정리한다.
-
한국어 토크나이저 실험기 1 - 형태소 가설이 무너지다
약 17분 읽기한국어 토크나이저를 직접 만들며 겪은 첫 번째 실험 기록. 형태소 경계를 반영하면 좋아질 거라는 가설에서 출발해, α와 SuperBPE가 거의 듣지 않고 pre-tokenizer가 핵심 변수로 떠오르기까지의 과정을 정리한다.
-
4. 분류 I — 로지스틱 회귀
약 29분 읽기회귀에서 분류로 넘어간다. 선형 회귀의 한계를 시그모이드 함수로 극복하는 로지스틱 회귀, 닫힌 해가 없을 때 파라미터를 찾는 경사 하강법, 다중 클래스로 확장하는 소프트맥스까지 — 분류 문제의 기본 틀을 세운다.
-
3. 선형 회귀 II
약 21분 읽기선형 회귀를 현실 데이터에 적용하기 위한 확장을 다룬다. 범주형 변수 처리, 변수 간 상호작용 모델링, 수많은 피처 중 최적의 조합을 고르는 피처 선택 등을 살펴본다.
-
2. 선형 회귀 I
약 28분 읽기선형 회귀(Linear Regression)의 핵심을 파헤친다. RSS를 최소화하는 최소 제곱법, 그 배후의 최대 우도 추정(MLE), 행렬로 정리한 정규 방정식까지 — 머신러닝에서 가장 기본이 되는 예측 모델의 수학적 토대를 세운다.
-
1. 지도 학습의 기초
약 23분 읽기머신러닝의 출발점 지도 학습(Supervised Learning)의 4단계(모델 형태 결정, 목표 정의, 학습, 예측)를 직접 코드로 따라가며 이해한다. 파라메트릭 모델과 논파라메트릭 모델의 차이, 그리고 과적합의 위험까지.
-
토크나이저, 언어 모델의 보이지 않는 관문
Updated:약 18분 읽기한국어 토크나이저의 원리부터 BPE, WordPiece, SentencePiece까지. 한국어가 영어보다 토큰을 2배 더 쓰는 이유와 언어 모델 성능에 미치는 영향을 깊이 있게 다룹니다.
-
AI 개발을 시작하며
약 4분 읽기2023년 어느 밤, 나는 외장하드에 120GB가 넘는 파일을 황급히 다운로드하고 있었다.
Recent Posts
-
LLaMa Fine-tuning
약 9분 읽기LLaMa 유출 사건 이후 로컬 Ai에 관심이 생겨 여러 시도를 했습니다. 그간 시행 착오를 정리했습니다.
-
로컬 AI - LLaMa 유출과 기술 변곡점
약 16분 읽기여러분은 새로운 기술이 산업 전반, 더 나아가 우리 일상을 바꾸는 순간을 목격해보셨나요?
-
사업 아이디어 101, 두 번째 이야기
약 7분 읽기101가지 사업 아이디어 중 13가지를 실제로 테스트하며 배운, 랜딩 페이지와 광고 기반 초기 검증의 기록.
-
사업 아이디어 101, 지금 시작합니다
약 18분 읽기첫 창업 실패 이후 다시 진짜 문제를 찾기 위해 2주 동안 적어 내려간 101가지 사업 아이디어.