pile·
AI / ML·데브시스터즈데브시스터즈·

강화학습으로 더 재미있는 게임 만들기

문제쿠키런 퍼즐월드는 맵 1,500개·쿠키 40종이고 매주 30개 맵이 추가돼, 사람이 밸런싱하려면 1,152만 판·8,000일이 필요했다.
접근PPO(Proximal Policy Optimization)와 ResNet 정책 네트워크로 강화학습 봇을 학습. 색상 불변성으로 탐색 공간을 1/720로 줄이고, 0.01초/행동 Cython 목업 환경을 만들었다.
결과실험 시간이 3일에서 반나절로 6배 단축. 쿠키별 강도를 정량화해 강화 시스템 도입 시 매출 영향까지 사전 예측이 가능해졌다.
데브시스터즈
데브시스터즈 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2