Hugging-Face-Modelle per Coding Agent auf Amazon SageMaker AI deployen
TL;DR
AWS zeigt, wie du Hugging-Face-Modelle mit einem Coding Agent produktionsreif auf Amazon SageMaker AI bringst. Sechs Open-Source-Agent-Skills übernehmen Planung, AWS-Setup, IAM-Rollen, die Wahl des passenden Serving-Containers und die Produktionsstandards. Am Ende steht ein Real-time-Endpoint mit Autoscaling, drei CloudWatch-Alarmen und einem geprüften Teardown. Getestet wurde unter anderem mit Kiro und Claude Code, und die Endpoints kosten laufend Geld, solange sie aktiv sind.
Nauti's Take
Für Teams ohne MLOps-Spezialisten ist das ein echter Vorteil: Container-Wahl, IAM-Rollen, Autoscaling und Alarme kommen als geprüfte Skills, und ein Coding Agent erledigt den Rest. Vorsicht beim Kostenrisiko, denn Real-time-Endpoints laufen rund um die Uhr und kosten pro Instanz etwa 1,41 Dollar pro Stunde.
Wer schnell Open-Weight-Modelle testen will, profitiert, sollte den Teardown-Schritt aber nie auslassen.