Amazon Bedrock

Filed under

26 posts

추론 프로파일로 앱 단위 Bedrock 비용 추적하기

애플리케이션 추론 프로파일은 Bedrock 호출에 비용 배분 태그를 붙여 공용 청구서를 팀별 항목으로 나눈다. 어려운 부분은 태그 설계다.

Jul 10, 2026 5 min

EU AI Act, 8월 2일: 밀리지 않은 마감일

디지털 옴니버스는 고위험 마감일을 2027년과 2028년으로 미뤘다. 제50조 투명성 의무는 그대로 2026년 8월 2일 발효된다.

Jul 08, 2026 6 min

SageMaker vs Bedrock: 기술적 결정이 아니라 조직적 결정

SageMaker냐 Bedrock이냐는 결국 모델을 소유하는 팀이 조직에 있는지를 묻는 질문이다. 슬라이드가 아니라 실제 팀 구조에 맞춰 선택하라.

Jul 06, 2026 5 min

당신의 문서를 통한 프롬프트 인젝션: RAG의 공격 표면

지식 베이스는 신뢰할 수 없는 입력이다. 검색은 공격자가 작성한 텍스트를 모델에 그대로 전달하므로, 통제는 수집 시점의 스캔이 핵심이다.

Jul 04, 2026 5 min

AWS 먼슬리 (2026년 6월): 에이전트가 피드백 루프를 얻다

2026년 6월 AWS는 뉴욕 서밋에서 프로덕션 트레이스를 에이전트 개선으로 바꾸고 보안용 Continuum을 내놓았으며 AgentCore 하네스를 정식 출시했다.

Jun 30, 2026 5 min

멀티 에이전트 시스템의 진짜 한계는 분당 토큰 수다

Amazon Bedrock가 이제 Service Quotas에서 모델별 분당 토큰 수 할당량을 노출한다. agent에게는 TPM이 실제 확장 상한선이다. 429가 터지기 전에 미리 계획하라.

Jun 21, 2026 5 min

컨텍스트 윈도우는 당신 편이 아니다

거대한 컨텍스트 윈도우는 검색을 대체하지 못한다. 프롬프트가 길어질수록 재현율은 떨어지고 비용은 토큰마다 늘어나며 중간 부분은 대충 읽힌다.

Jun 03, 2026 4 min

AWS 월간 정리 (2026년 5월): 에이전트가 지갑을 얻다

2026년 5월 AWS: AgentCore Payments로 에이전트가 거래하고, Agent Toolkit for AWS와 정식 출시된 관리형 MCP 서버가 도구 체인을 단단하게 만든다.

May 31, 2026 3 min

Haiku가 Opus를 이길 때: Bedrock에서의 모델 적정 사이징

모든 호출을 기본값으로 Opus에 맡기는 것이 LLM 청구서가 부풀어 오르는 이유다. 작업 유형별로 라우팅하라. 기계적인 다수는 Haiku, Opus는 어려운 경우의 에스컬레이션 경로로.

May 22, 2026 4 min

에이전틱 RAG는 대부분 필요 없는 지연 시간이다

에이전틱 RAG는 검색 홉을 반복하며, 각 홉은 모델 왕복이다. 대부분의 질문에는 잘 만든 쿼리 하나가 이긴다. 지연을 감수할 가치가 있을 때만 루프를 써라.

May 18, 2026 4 min

에이전트보다 먼저 평가: 점수를 매길 수 없다면 출시할 수도 없다

평가 하네스가 없으면 모든 에이전트 변경은 감으로 하는 확인일 뿐이다. 에이전트보다 먼저 점수판을 만들고, LLM 심사자도 틀릴 수 있는 부품으로 다뤄라.

May 14, 2026 3 min

시맨틱 캐싱: 서로 다른 두 질문, 하나의 답

시맨틱 캐시는 다르게 표현된 두 질문에 하나의 저장된 답을 돌려준다. 비용과 지연을 줄이지만, 잘못된 히트는 자신 있게 틀린 답을 내놓는다.

May 11, 2026 4 min

LLM 게이트웨이: 모든 플랫폼 팀이 결국 만들게 되는 이유

두 번째 팀이 모델을 호출하기 시작하면 통제되지 않은 확산이 시작된다. LLM 게이트웨이는 인증, 쿼터, 라우팅, 감사를 한곳에 모은다. 자체 구축 대 LiteLLM 대 API Gateway.

May 04, 2026 4 min

AWS 월간 브리핑 (2026년 4월): OpenAI가 Bedrock에 상륙하다

2026년 4월 AWS: OpenAI 모델, Codex, Managed Agents가 Bedrock에 도착했고, AgentCore는 관리형 하니스와 CLI를 추가해 에이전트로 가는 길을 단축했다.

Apr 30, 2026 3 min

리전 간 추론: 저렴한 복원력인가, 데이터 거주지 함정인가?

Bedrock 리전 간 추론은 처리량과 스로틀링을 완화한다. 하지만 글로벌 프로필은 프롬프트를 그 지리적 경계 밖으로 라우팅할 수 있다. 먼저 데이터 거주지부터 확인하라.

Apr 26, 2026 3 min

LLM 청구서는 관측 가능성 문제다

예상치 못한 Bedrock 청구서는 가격 문제가 아니라 가시성 문제다. 토큰을 기능, 테넌트, 에이전트에 귀속시킬 수 없다면 그것을 관리할 수 없다.

Apr 21, 2026 4 min

Bedrock 배치 추론: 기다릴 수 있다면 반값

Amazon Bedrock 배치 추론은 온디맨드 가격의 50%에 실행된다. 유일한 대가는 지연 시간뿐이다. 아무도 기다리지 않는 작업이라면 이 거래는 공짜 돈이나 다름없다.

Apr 17, 2026 4 min

멀티 테넌트 LLM 앱: 공유 모델 위에서 고객을 격리하기

하나의 공유 Bedrock 모델, 여러 고객. 모델은 상태를 갖지 않으므로 격리는 여러분의 몫이다. 검색 범위를 정하고, 쿼터를 제한하고, 테넌트별 아이덴티티를 끝까지 전달하라.

Apr 13, 2026 4 min

구조화된 출력이 영리한 파싱을 이긴다

아직도 모델 텍스트에서 정규식으로 JSON을 파싱하고 있는가? 이제 그만두자. Bedrock 구조화된 출력은 디코딩 단계에서 JSON Schema를 강제해 응답이 처음부터 유효하다.

Apr 06, 2026 4 min

Bedrock 프롬프트 캐싱: 대부분의 팀이 놓치는 90% 할인

Bedrock 프롬프트 캐싱은 반복되는 프리픽스를 90% 할인된 가격에 읽지만, 캐시 쓰기는 일반 입력 토큰보다 비싸다. 브레이크포인트 위치가 결과를 가른다.

Apr 02, 2026 4 min

AWS 월간 정리 (2026년 3월): 거버넌스가 에이전트를 찾아오다

2026년 3월 AWS: AgentCore Policy와 Evaluations 정식 출시, Elemental Inference 등장. 에이전트 거버넌스가 데모에서 프로덕션 제어 플레인으로 넘어간다.

Mar 31, 2026 3 min

스트리밍 응답은 성능이 아니라 UX 결정이다

모델 응답을 스트리밍하는 것은 첫 토큰까지의 시간에 관한 사용자 경험 선택이지, 속도를 고치는 방법이 아니다. 때로는 구조화된 출력과 도구 사용을 더 나쁘게 만든다.

Mar 24, 2026 3 min

Bedrock Agents vs 직접 만든 루프

Amazon Bedrock Agents는 오케스트레이션, 메모리, 도구 호출을 대신 처리해준다. 관리형 프레임워크가 실제로 일을 덜어주는 경우와 조용히 발목을 잡는 경우를 정리했다.

Mar 18, 2026 4 min

파인튜닝을 멈춰라. 필요한 건 RAG, 캐시, 그리고 더 나은 프롬프트다

파인튜닝과 프로비저닝된 처리량은 대부분의 LLM 문제에 대한 값비싼 답이다. 더 저렴한 길은 검색, 프롬프트 캐싱, 더 나은 프롬프트다.

Mar 09, 2026 4 min

Knowledge Base 청킹, RAG 품질이 무너지는 지점

대부분의 잘못된 RAG 답변은 모델 문제가 아니라 검색 문제다. Bedrock Knowledge Bases의 고정, 시맨틱, 계층형 청킹이 품질을 결정하는 방식.

Mar 05, 2026 4 min

Bedrock Guardrails는 프롬프트 인젝션을 막아주지 않는다

Amazon Bedrock Guardrails는 콘텐츠를 필터링할 뿐, 행동을 승인하지 않는다. 진짜 프롬프트 인젝션 방어는 입력 격리, 도구 허용목록, IAM 범위 지정이다.

Mar 03, 2026 4 min