AI/ML
한글 임베딩에 대한 고찰: KURE-v1·v2부터 Qwen3까지, 한국어 임베딩 모델은 어떻게 동작할까
KURE-v1과 v2의 동작 방식 차이를 중심으로 한국어 임베딩 모델 20여 종의 백본·표현 방식·학습 목표를 다섯 가지 설계 축으로 나눠 읽고, MTEB(kor, v2) 태스크별 점수와 상황별 선택 기준을 정리합니다.
Recent writing
all posts →
2026-10-06
벡터 DB 컬렉션은 어떻게 나눌까: 레코드 구성부터 컬렉션 설계까지
벡터 DB 레코드를 이루는 ID·벡터·원문·메타데이터와 RDB 테이블과의 대응, 컬렉션을 나누는 기준과 파티션·테넌트·샤드 같은 대안, 여러 컬렉션을 함께 검색할 때 맞춰야 할 벡터 공간을 공...
ai/ml
2026-09-29
“DB 페일오버는 1초라는데” 애플리케이션은 왜 DB를 못 찾을까?
Aurora MySQL 페일오버를 19개 JDBC 구성으로 동시에 관찰했습니다. 약 2초와 약 30분으로 갈린 쓰기 복구, 옛 writer 재접속, 에러 없는 쓰기 정지를 실제 기록으로 살펴보...
mysql
2026-09-27
RAG 평가 데이터셋: Gold·QA 구축부터 검색·답변 품질 평가까지
Gold 데이터와 QA로 평가 데이터셋을 만들고, 데이터를 나누는 기준과 검색 품질·답변 품질을 따로 평가하는 방법, 운영하며 평가 데이터셋을 넓히는 순서를 다룹니다.
ai/ml
2026-09-27
RAG를 위한 데이터 준비: 범위·요건 분석부터 전처리·피처 설계까지
데이터 범위와 규모 조사, 검증할 수 있는 요건 정의, 의미와 근거 위치를 보존하는 전처리, 문서 RAG에 맞춘 피처 설계를 정리합니다.
ai/ml
2026-09-27
AWS에서만 쓰는 벡터 검색: S3 Vectors부터 Bedrock Knowledge Bases까지
S3 Vectors, OpenSearch Serverless, DynamoDB 등 AWS 전용 벡터 검색 7종을 인덱스, 질의당 k, 필터, 규모, 확장·과금 단위로 비교하고 Bedrock K...
ai/ml
2026-09-26
벡터 DB는 어떻게 고를까: 선택 기준과 제품별 기능 비교
인덱스와 압축, 질의당 최대 k, 필터와 멀티테넌시, 하이브리드 검색, 1억 건 규모의 메모리, 샤딩과 확장을 기준으로 벡터 DB 12종을 공식 문서에 근거해 비교합니다.
ai/ml
2026-09-24
벡터 DB란 무엇인가: 중요해진 이유와 주요 제품, 사용 지표로 보는 시장
임베딩·유사도 검색·RAG의 관계부터 오픈소스와 상용 제품까지 정리하고 개발자 설문·DB-Engines·GitHub 별 수가 각각 무엇을 재는지 구분해 읽습니다.
ai/ml
2025-05-23
MySQL 복제지연
MySQL 8.4의 복제 중단·수신 지연·적용 지연을 구분하고, 대형 트랜잭션·잠금·병렬 복제·스토리지 병목과 쓰기 직후 읽기 문제를 진단합니다.
mysql
Advertisement