AI
13개의 글
GPT-6 Astra 달라진점
새 모델이 나오면 제일 먼저 하는 일이 가격표와 모델 문서 두 페이지를 나란히 열어놓고 지금 쓰는 모델과 비교하는 것이다. 발표문에 붙은 벤치마크 표는 대체로 좋아 보이게 그려져 있어서, 실제로 갈…
Langfuse 자체 호스팅으로 LLM 앱 관측하기 - 트레이스 계측, 토큰 비용 추적, 프롬프트 버전과 평가 대시보드
LLM 애플리케이션을 운영에 올리고 나면 항상 같은 질문을 받는다. "이번 달 OpenAI 요금이 왜 이렇게 나왔나", "어제 그 답변이 왜 이상하게 나갔나", "프롬프트를 바꿨는데 품질이 좋아진 …
Claude 모델별 차이점 (Haiku, Sonnet, Opus, Fable)
작년 12월에 ChatGPT와 Claude의 차이점 을 정리한 적이 있는데, 그새 Claude를 도입한 팀들에게서 받는 질문의 결이 싹 달라졌다. 예전에는 "뭘 쓸까"였다면 지금은 "Claude 모…
쿠버네티스에서 GPU 한 장을 여러 파드가 나눠 쓰기: Time-Slicing vs MIG
GPU 노드를 처음 붙이고 나면 곧 이런 상황을 만난다. A100 한 장이 노드에 꽂혀 있는데, 추론 파드 하나가 그걸 통째로 물고 있고 나머지 파드는 Pending 으로 줄을 선다. GPU 메모리…
AWS Bedrock Knowledge Bases로 사내 문서 RAG 챗봇 만들기
사내 위키나 운영 문서를 뒤지다가 "이 설정 어디에 적혀 있더라" 하고 시간을 버리는 일이 잦다. 이런 문서를 검색해서 답을 만들어 주는 RAG 챗봇을 직접 짜려면 임베딩, 벡터 DB, 프롬프트 조…
Claude API 프롬프트 캐싱(cache_control)으로 반복 프롬프트 비용 줄이기: 브레이크포인트 설계와 절감 측정
1. 개요 사내 챗봇이나 에이전트를 붙여 달라는 요청을 받으면 기능 이야기보다 비용 이야기가 먼저 나올 때가 많습니다. 예전에 토큰 계산 스크립트를 정리한 글에서 캐싱 부분은 슬쩍 넘겼던 기억이 있…
GPU EC2에 Ollama + Open WebUI로 사내 로컬 LLM API 서버 구축하기 (OpenAI 호환 엔드포인트)
요약부터 말씀드릴게요. Ollama 를 GPU 서버에 설치하면 그 자체로 11434 포트에 OpenAI 호환 API( /v1/chat/completions )가 열립니다. 여기에 Open WebUI…
Claude와 ChatGPT를 혼합한 코드 개발 및 리뷰 방법
Claude와 ChatGPT를 혼합해 코드 작성 및 리뷰에 활용하면, 각 모델의 강점을 분리하여 사용할 수 있어 생산성과 품질을 함께 높일 수 있습니다. 핵심은 한 모델로 처음부터 끝까지 처리하기보…
Claude Code 모델 효율적 활용 방안 공유
Claude Code는 코드 생성 및 분석에 강점을 가진 AI 코딩 도구로, 단순 코드 작성뿐만 아니라 설계, 리뷰, 문서화, 디버깅 등 개발 전반에 걸쳐 활용할 수 있습니다. 다만 구독 플랜에 따…
AWS Bedrock과 ChatGPT는 어떻게 다른가?
ChatGPT와 AWS Bedrock의 출발점 AWS Bedrock과 ChatGPT는 모두 생성형 AI를 기반으로 하지만, 출발점과 지향점이 다르다. 이 둘의 차이는 “어떤 모델이 더 똑똑한가”가 …
AWS Bedrock 서비스 활용사례
AWS Bedrock을 어떻게 바라볼 것인가 AWS Bedrock 을 이해하는 가장 좋은 방법은 이를 “AI 모델을 제공하는 서비스”가 아니라 생성형 AI를 실제 업무 시스템 안으로 끌어들이기 위한…
ChatGPT와 Claude의 차이점
1. Claude에게 물어본 ChatGPT와 Claude의 차이점 ChatGPT와 Claude의 차이점 ChatGPT와 Claude는 현재 가장 널리 사용되는 대규모 언어모델 기반 AI 챗봇으로, …
에이전틱 AI란 무엇인가?
에이전틱 AI (Agentic AI)에 대한 개요 에이전틱 AI는 사용자의 명시적 지시 없이도 자율적으로 판단하고 행동할 수 있는 인공지능 시스템을 의미한다. 이는 전통적인 대화형 AI와 구별되는 …