Text-to-image diffusion model은 텍스트로 이미지를 생성하는 데는 강력하지만, 기존 이미지의 구조를 유지하면서 의미와 외형을 바꾸는 것은 여전히 어렵다. SDEdit 같은 방법은 구조 보존과 text fidelity 사이에 본질적인 trade-off가 있고, Prompt-to-Prompt는 cross-attention 조작 기반이라 fine-grained structure 제어에 한계가 있다.
(믿기지 않지만)금연을 시작한 지 네 달이 지났다. 시간으로 보면 길지 않지만, 감각으로는 꽤 많은 층위가 지나간 느낌이다. 처음에는 단순히 ‘참는다’에 가까웠다면, 이제는 ‘덜 떠오른다’에 가깝다. 완전히 사라진 건 아니지만, 생각의 표면으로 올라오는 빈도가 눈에 띄게 줄었다. 흡연 욕구는 사라지는 것이 아니라, 점점 더 낮은 우선순위로 밀려나는 쪽에 가깝다는 걸 이 시점에서 체감한다.
LLM API를 호출해서 답변을 받는 건 쉽다. 하지만 agent를 만들려면 구조가 달라진다. 핵심은 LLM이 tool을 호출하고, 그 결과를 다시 받아서 판단하는 루프를 만드는 것이다. 이 글에서는 Claude API 기반으로 실제 동작하는 agent를 처음부터 설계하는 방법을 정리한다.