Amazon Bedrock
Filed under
추론 프로파일로 앱 단위 Bedrock 비용 추적하기
애플리케이션 추론 프로파일은 Bedrock 호출에 비용 배분 태그를 붙여 공용 청구서를 팀별 항목으로 나눈다. 어려운 부분은 태그 설계다.
EU AI Act, 8월 2일: 밀리지 않은 마감일
디지털 옴니버스는 고위험 마감일을 2027년과 2028년으로 미뤘다. 제50조 투명성 의무는 그대로 2026년 8월 2일 발효된다.
SageMaker vs Bedrock: 기술적 결정이 아니라 조직적 결정
SageMaker냐 Bedrock이냐는 결국 모델을 소유하는 팀이 조직에 있는지를 묻는 질문이다. 슬라이드가 아니라 실제 팀 구조에 맞춰 선택하라.
당신의 문서를 통한 프롬프트 인젝션: RAG의 공격 표면
지식 베이스는 신뢰할 수 없는 입력이다. 검색은 공격자가 작성한 텍스트를 모델에 그대로 전달하므로, 통제는 수집 시점의 스캔이 핵심이다.
AWS 먼슬리 (2026년 6월): 에이전트가 피드백 루프를 얻다
2026년 6월 AWS는 뉴욕 서밋에서 프로덕션 트레이스를 에이전트 개선으로 바꾸고 보안용 Continuum을 내놓았으며 AgentCore 하네스를 정식 출시했다.
멀티 에이전트 시스템의 진짜 한계는 분당 토큰 수다
Amazon Bedrock가 이제 Service Quotas에서 모델별 분당 토큰 수 할당량을 노출한다. agent에게는 TPM이 실제 확장 상한선이다. 429가 터지기 전에 미리 계획하라.
컨텍스트 윈도우는 당신 편이 아니다
거대한 컨텍스트 윈도우는 검색을 대체하지 못한다. 프롬프트가 길어질수록 재현율은 떨어지고 비용은 토큰마다 늘어나며 중간 부분은 대충 읽힌다.
AWS 월간 정리 (2026년 5월): 에이전트가 지갑을 얻다
2026년 5월 AWS: AgentCore Payments로 에이전트가 거래하고, Agent Toolkit for AWS와 정식 출시된 관리형 MCP 서버가 도구 체인을 단단하게 만든다.
Haiku가 Opus를 이길 때: Bedrock에서의 모델 적정 사이징
모든 호출을 기본값으로 Opus에 맡기는 것이 LLM 청구서가 부풀어 오르는 이유다. 작업 유형별로 라우팅하라. 기계적인 다수는 Haiku, Opus는 어려운 경우의 에스컬레이션 경로로.
에이전틱 RAG는 대부분 필요 없는 지연 시간이다
에이전틱 RAG는 검색 홉을 반복하며, 각 홉은 모델 왕복이다. 대부분의 질문에는 잘 만든 쿼리 하나가 이긴다. 지연을 감수할 가치가 있을 때만 루프를 써라.
에이전트보다 먼저 평가: 점수를 매길 수 없다면 출시할 수도 없다
평가 하네스가 없으면 모든 에이전트 변경은 감으로 하는 확인일 뿐이다. 에이전트보다 먼저 점수판을 만들고, LLM 심사자도 틀릴 수 있는 부품으로 다뤄라.
시맨틱 캐싱: 서로 다른 두 질문, 하나의 답
시맨틱 캐시는 다르게 표현된 두 질문에 하나의 저장된 답을 돌려준다. 비용과 지연을 줄이지만, 잘못된 히트는 자신 있게 틀린 답을 내놓는다.
LLM 게이트웨이: 모든 플랫폼 팀이 결국 만들게 되는 이유
두 번째 팀이 모델을 호출하기 시작하면 통제되지 않은 확산이 시작된다. LLM 게이트웨이는 인증, 쿼터, 라우팅, 감사를 한곳에 모은다. 자체 구축 대 LiteLLM 대 API Gateway.
AWS 월간 브리핑 (2026년 4월): OpenAI가 Bedrock에 상륙하다
2026년 4월 AWS: OpenAI 모델, Codex, Managed Agents가 Bedrock에 도착했고, AgentCore는 관리형 하니스와 CLI를 추가해 에이전트로 가는 길을 단축했다.
리전 간 추론: 저렴한 복원력인가, 데이터 거주지 함정인가?
Bedrock 리전 간 추론은 처리량과 스로틀링을 완화한다. 하지만 글로벌 프로필은 프롬프트를 그 지리적 경계 밖으로 라우팅할 수 있다. 먼저 데이터 거주지부터 확인하라.
LLM 청구서는 관측 가능성 문제다
예상치 못한 Bedrock 청구서는 가격 문제가 아니라 가시성 문제다. 토큰을 기능, 테넌트, 에이전트에 귀속시킬 수 없다면 그것을 관리할 수 없다.
Bedrock 배치 추론: 기다릴 수 있다면 반값
Amazon Bedrock 배치 추론은 온디맨드 가격의 50%에 실행된다. 유일한 대가는 지연 시간뿐이다. 아무도 기다리지 않는 작업이라면 이 거래는 공짜 돈이나 다름없다.
멀티 테넌트 LLM 앱: 공유 모델 위에서 고객을 격리하기
하나의 공유 Bedrock 모델, 여러 고객. 모델은 상태를 갖지 않으므로 격리는 여러분의 몫이다. 검색 범위를 정하고, 쿼터를 제한하고, 테넌트별 아이덴티티를 끝까지 전달하라.
구조화된 출력이 영리한 파싱을 이긴다
아직도 모델 텍스트에서 정규식으로 JSON을 파싱하고 있는가? 이제 그만두자. Bedrock 구조화된 출력은 디코딩 단계에서 JSON Schema를 강제해 응답이 처음부터 유효하다.
Bedrock 프롬프트 캐싱: 대부분의 팀이 놓치는 90% 할인
Bedrock 프롬프트 캐싱은 반복되는 프리픽스를 90% 할인된 가격에 읽지만, 캐시 쓰기는 일반 입력 토큰보다 비싸다. 브레이크포인트 위치가 결과를 가른다.
AWS 월간 정리 (2026년 3월): 거버넌스가 에이전트를 찾아오다
2026년 3월 AWS: AgentCore Policy와 Evaluations 정식 출시, Elemental Inference 등장. 에이전트 거버넌스가 데모에서 프로덕션 제어 플레인으로 넘어간다.
스트리밍 응답은 성능이 아니라 UX 결정이다
모델 응답을 스트리밍하는 것은 첫 토큰까지의 시간에 관한 사용자 경험 선택이지, 속도를 고치는 방법이 아니다. 때로는 구조화된 출력과 도구 사용을 더 나쁘게 만든다.
Bedrock Agents vs 직접 만든 루프
Amazon Bedrock Agents는 오케스트레이션, 메모리, 도구 호출을 대신 처리해준다. 관리형 프레임워크가 실제로 일을 덜어주는 경우와 조용히 발목을 잡는 경우를 정리했다.
파인튜닝을 멈춰라. 필요한 건 RAG, 캐시, 그리고 더 나은 프롬프트다
파인튜닝과 프로비저닝된 처리량은 대부분의 LLM 문제에 대한 값비싼 답이다. 더 저렴한 길은 검색, 프롬프트 캐싱, 더 나은 프롬프트다.
Knowledge Base 청킹, RAG 품질이 무너지는 지점
대부분의 잘못된 RAG 답변은 모델 문제가 아니라 검색 문제다. Bedrock Knowledge Bases의 고정, 시맨틱, 계층형 청킹이 품질을 결정하는 방식.
Bedrock Guardrails는 프롬프트 인젝션을 막아주지 않는다
Amazon Bedrock Guardrails는 콘텐츠를 필터링할 뿐, 행동을 승인하지 않는다. 진짜 프롬프트 인젝션 방어는 입력 격리, 도구 허용목록, IAM 범위 지정이다.