본문 바로가기
삵

AI

18개의 글

Claude Code/Codex 프록시로 관측하기

AI

사내 모니터링 시스템에 LLM 호출 관측은 이미 있었다. 없는 것은 "코드를 못 건드리는 클라이언트"의 호출을 잡는 방법이었다. 그래서 투명 게이트웨이 프록시를 만들었고, Claude Code는 3…

netrojokenetrojoke·2026년 9월 29일·조회 7

AIDC 모니터링은 어디로 가야 하나

AI

예전에 NVML은 무엇이고 어디에 쓰나 라는 글에서 GPU 한 장의 온도와 전력, ECC 카운터를 읽는 방법을 다뤘다. 그런데 GPU 서버가 몇 대에서 몇십 대, 몇백 대로 늘어나면 고민이 달라진다…

냉냉장고를사다줘·2026년 9월 29일·조회 2

NVML은 무엇이고 어디에 쓰나

AI

GPU 노드를 운영하면 nvidia-smi는 매일 치게 된다. 그런데 그 뒤에 뭐가 있는지는 잘 안 들여다본다. 그러다 파드 안에서 Failed to initialize NVML 같은 에러를 처음 …

냉냉장고를사다줘·2026년 9월 29일·조회 1

Vercel v0로 웹사이트 만들기

AI

요즘 사내에서 "간단한 관리 화면 하나만 빨리 띄워달라"는 요청을 자주 받습니다. 예전 같으면 Next.js 프로젝트부터 만들고 컴포넌트를 하나씩 붙였을 텐데, 이번에는 Vercel의 v0를 처음부…

포포스트맨·2026년 9월 23일·조회 5

Open WebUI로 사내 자체 호스팅 ChatGPT 만들기

AI

사내에서 외부 ChatGPT 사용을 막아둔 곳이 늘고 있다. 계약서나 소스 코드를 붙여넣는 순간 데이터가 밖으로 나가니 보안팀 입장에선 당연한 조치다. 그래서 요즘 "우리 망 안에서만 도는 챗봇을 …

stdio.hstdio.h·2026년 9월 22일·조회 5
AI

GPT-6 Astra 달라진점

새 모델이 나오면 제일 먼저 하는 일이 가격표와 모델 문서 두 페이지를 나란히 열어놓고 지금 쓰는 모델과 비교하는 것이다. 발표문에 붙은 벤치마크 표는 대체로 좋아 보이게 그려져 있어서, 실제로 갈…

고고구마엔사이다·2026년 9월 8일·조회 23
AI

Langfuse 자체 호스팅으로 LLM 앱 관측하기 - 트레이스 계측, 토큰 비용 추적, 프롬프트 버전과 평가 대시보드

LLM 애플리케이션을 운영에 올리고 나면 항상 같은 질문을 받는다. "이번 달 OpenAI 요금이 왜 이렇게 나왔나", "어제 그 답변이 왜 이상하게 나갔나", "프롬프트를 바꿨는데 품질이 좋아진 …

아아주라·2026년 9월 6일·조회 10
AI

Claude 모델별 차이점 (Haiku, Sonnet, Opus, Fable)

작년 12월에 ChatGPT와 Claude의 차이점 을 정리한 적이 있는데, 그새 Claude를 도입한 팀들에게서 받는 질문의 결이 싹 달라졌다. 예전에는 "뭘 쓸까"였다면 지금은 "Claude 모…

고고구마엔사이다·2026년 8월 23일·조회 22
AI

쿠버네티스에서 GPU 한 장을 여러 파드가 나눠 쓰기: Time-Slicing vs MIG

GPU 노드를 처음 붙이고 나면 곧 이런 상황을 만난다. A100 한 장이 노드에 꽂혀 있는데, 추론 파드 하나가 그걸 통째로 물고 있고 나머지 파드는 Pending 으로 줄을 선다. GPU 메모리…

냉냉장고를사다줘·2026년 8월 17일·조회 14
AI

AWS Bedrock Knowledge Bases로 사내 문서 RAG 챗봇 만들기

사내 위키나 운영 문서를 뒤지다가 "이 설정 어디에 적혀 있더라" 하고 시간을 버리는 일이 잦다. 이런 문서를 검색해서 답을 만들어 주는 RAG 챗봇을 직접 짜려면 임베딩, 벡터 DB, 프롬프트 조…

고고구마엔사이다·2026년 8월 7일·조회 9
AI

Claude API 프롬프트 캐싱(cache_control)으로 반복 프롬프트 비용 줄이기: 브레이크포인트 설계와 절감 측정

1. 개요 사내 챗봇이나 에이전트를 붙여 달라는 요청을 받으면 기능 이야기보다 비용 이야기가 먼저 나올 때가 많습니다. 예전에 토큰 계산 스크립트를 정리한 글에서 캐싱 부분은 슬쩍 넘겼던 기억이 있…

주말만기다려주말만기다려·2026년 7월 29일·조회 13
AI

GPU EC2에 Ollama + Open WebUI로 사내 로컬 LLM API 서버 구축하기 (OpenAI 호환 엔드포인트)

요약부터 말씀드릴게요. Ollama 를 GPU 서버에 설치하면 그 자체로 11434 포트에 OpenAI 호환 API( /v1/chat/completions )가 열립니다. 여기에 Open WebUI…

냉냉장고를사다줘·2026년 6월 23일·조회 16

Claude와 ChatGPT를 혼합한 코드 개발 및 리뷰 방법

AI

Claude와 ChatGPT를 혼합해 코드 작성 및 리뷰에 활용하면, 각 모델의 강점을 분리하여 사용할 수 있어 생산성과 품질을 함께 높일 수 있습니다. 핵심은 한 모델로 처음부터 끝까지 처리하기보…

나나크나로·2026년 3월 21일·조회 1,003

Claude Code 모델 효율적 활용 방안 공유

AI

Claude Code는 코드 생성 및 분석에 강점을 가진 AI 코딩 도구로, 단순 코드 작성뿐만 아니라 설계, 리뷰, 문서화, 디버깅 등 개발 전반에 걸쳐 활용할 수 있습니다. 다만 구독 플랜에 따…

나나크나로·2026년 3월 21일·조회 402

AWS Bedrock과 ChatGPT는 어떻게 다른가?

AI

ChatGPT와 AWS Bedrock의 출발점 AWS Bedrock과 ChatGPT는 모두 생성형 AI를 기반으로 하지만, 출발점과 지향점이 다르다. 이 둘의 차이는 “어떤 모델이 더 똑똑한가”가 …

1103동103호·2025년 12월 16일·조회 1,085

AWS Bedrock 서비스 활용사례

AI

AWS Bedrock을 어떻게 바라볼 것인가 AWS Bedrock 을 이해하는 가장 좋은 방법은 이를 “AI 모델을 제공하는 서비스”가 아니라 생성형 AI를 실제 업무 시스템 안으로 끌어들이기 위한…

1103동103호·2025년 12월 16일·조회 1,067

ChatGPT와 Claude의 차이점

AI

1. Claude에게 물어본 ChatGPT와 Claude의 차이점 ChatGPT와 Claude의 차이점 ChatGPT와 Claude는 현재 가장 널리 사용되는 대규모 언어모델 기반 AI 챗봇으로, …

고고구마엔사이다·2025년 12월 15일·조회 1,075

에이전틱 AI란 무엇인가?

AI

에이전틱 AI (Agentic AI)에 대한 개요 에이전틱 AI는 사용자의 명시적 지시 없이도 자율적으로 판단하고 행동할 수 있는 인공지능 시스템을 의미한다. 이는 전통적인 대화형 AI와 구별되는 …

고고구마엔사이다·2025년 12월 15일·조회 1,405