전체 글 15

연합학습(FL) vs. 연합강화학습(FRL) — 구조적 차이점

1. 지도학습 기반 FL — 구조 복습연합학습의 대표 알고리즘인 FedAvg [1]의 동작은 이전 글에서 다뤘다. 간략히 복습하면 다음과 같다.1. 서버가 글로벌 모델 θ를 각 클라이언트에 배포2. 각 클라이언트가 로컬 데이터셋으로 K번 gradient descent 수행3. 업데이트된 파라미터를 서버에 전송4. 서버가 파라미터를 평균내어 글로벌 모델 갱신5. 수렴할 때까지 반복로컬 업데이트 수식은 다음과 같다.$$\theta_i^{(k+1)} = \theta_i^{(k)} - \eta \nabla_{\theta} \mathcal{L}_i(\theta_i^{(k)}, \mathcal{D}_i)$$$\mathcal{L}_i$: 클라이언트 $i$의 손실함수 (Cross-Entropy, MSE 등)$\math..

Federated Reinforcement Learning에서의 Heterogeneity

Federated Reinforcement Learning에서의 Heterogeneity — 왜 지도학습보다 더 어려운가이전 글 "Introduction of Federated Learning"에서 연합학습의 기본 개념과 Non-IID 문제를 정리했다. 이번 글에서는 강화학습(RL) 관점에서 연합학습의 이질성(Heterogeneity) 문제를 다룬다. 지도학습 기반 연합학습(Supervised FL)에서 이미 어려운 Non-IID 문제가 강화학습에서는 왜 더 어려워지는지, 그리고 최근 이를 해결하기 위한 연구들은 어떤 것들이 있는지 정리한다.1. 배경: 연합 강화학습(Federated Reinforcement Learning)이란연합 강화학습(FedRL)은 여러 에이전트가 각자의 환경에서 강화학습을 수행..

DeepSeekMath: GRPO(Group Relative Preference Optimization)

개요발행일: 2023요약:Motivation (문제정의): 수학적 추론이 LLM에게 어려운 과제. 기존 모델의 성능 격차와 데이터셋의 한계.해결방법: 대규모 수학 데이터 구축과 GRPO 알고리즘 제안.논문의 가치: GRPO는 메모리 효율성을 개선(value model 제거)하고, RL 학습의 현실적 장벽을 낮춤. 데이터 구축과 알고리즘 통합 패러다임 분석이 독립적 기여로 의미 있음.연구 분야: LLM/NLP, 강화학습지극히 개인적인 기술 활용도: ⭐️⭐️⭐️⭐️⭐️핵심 기법: 선호 학습/Alignment, 정책 최적화1. Motivation — 문제 정의 및 이전 연구의 한계핵심 문제: 수학적 추론은 LLM에게 가장 어려운 과제 중 하나다. 구조화된 논리 전개, 다단계 계산, 형식적 증명 등이 요구되기 ..

연구/LLM 2026.04.07

LLM Collaboration with Multi-Agent Reinforcement Learning

LLM Collaboration with Multi-Agent Reinforcement Learning발행일: 2025요약:Motivation (문제정의)여러 LLM이 협력해 복잡한 태스크를 해결하는 MAS는 유망하지만, 대부분의 LLM은 독립적으로 사전학습되어 효과적인 협력이 보장되지 않음.해결방법LLM 협업을 Dec-POMDP로 모델링하고, MAGRPO 알고리즘을 제안하여 공유 보상 구조를 활용하여 최적의 협력 정책을 도출.연구 분야: AI Agent, LLM/NLP, 강화학습지극히 주관적인 중요도(기술 활용도): ⭐️⭐️⭐️⭐️⭐️핵심 기법: 정책 최적화, 파인튜닝/전이학습arXiv 2025 | Northeastern University1. Motivation문제 정의여러 LLM이 협력해 복잡한 태..

연구/LLM 2026.04.07

Conditional Memory via Scalable Lookup:A New Axis of Sparsity for Large Language Models (Engram)

1. Motivation — 문제 정의 & 이전 연구의 한계언어 모델링의 이중성언어 모델링은 본질적으로 두 가지 이질적인 하위 작업을 동시에 수행해야 한다.작업 유형특성이상적인 처리 방식조합적 추론 (compositional reasoning)동적, 문맥 의존적깊은 신경 연산 (MoE)지식 검색 (knowledge retrieval)정적, 로컬, 고정적단순 룩업 (lookup)기존 Transformer의 구조적 비효율표준 Transformer에는 지식 검색을 위한 네이티브 프리미티브가 없다. "Alexander the Great"처럼 고정된 멀티토큰 엔티티 하나를 인식하는 데도 수 개의 Attention + FFN 레이어를 소비해야 한다. 이는 런타임에 정적 룩업 테이블을 비싼 연산으로 재구성하는 것과 ..

연구/LLM 2026.03.31

Amazon S3: 생성, IAM 설정, 보안, Python 연동까지

S3는 AWS에서 가장 많이 쓰이는 클라우드 스토리지입니다.하지만 막상 처음 시작하려면 권한 설정, 암호화, 퍼블릭 차단, 접근 방법 등 생각보다 신경 쓸 게 많습니다.이 글은 제가 테스트용 S3 환경을 구축하면서 직접 궁금했던 것들을 하나하나 정리한 실전 가이드입니다. 1. S3 버킷 생성AWS Console 접속 → S3 → 버킷 만들기입력 항목:버킷 이름: 소문자, 하이픈 가능, IP 형식 금지리전 선택버킷 이름 작성 팁버킷 이름은 전 세계에서 고유해야 하며, 조직 구조를 반영하면 관리가 쉽습니다.[조직명]-[서비스명]-[데이터종류]-[환경]예시:hippotnc-cogmo-interaction-devskku-federated-dataset-prod 2. 퍼블릭 액세스 차단실수로 전체 공개되는 걸 막..

MLOps 구축 2025.06.14

[논문리뷰] Filter Pruning via Geometric Median for Deep Convolutional Neural Networks Acceleration

1. Introduction and Motivations Filter pruning은 선택된 필터를 직접 제거하는 방법과 제거 하지 않고 가중치를 0으로 변경하여 구조는 유지하면서 가중치는 제거하는 방법이 있다. Hard pruning의 문제점을 해결하고자 Soft pruning 방법을 제안한 논문이 등장했다. 이 방법은 “Smaller-norm-less-important”의 기준에 따라 l2-norm값이 작은 필터를 제거하되 완전히 제거하는 것이 아니라 일정 에폭 이후에 가중치를 다시 update한다. 하지만 “Smaller-norm-less-important” 기준에서 중요한 가정이 있다; 1) 필터의 norm 분산이 충분히 커야하고, 2) 제거하고자 하는 norm이 충분히 작아야한다는 점이다. 다시..

[논문리뷰] Soft Filter Pruning for Accelerating Deep Convolutional Neural Networks

1. Introduction and Motivation 일반적으로 데이터가 충분한 상태에서 CNN 모델은 더 넓게, 더 깊게 쌓을수록 성능이 좋다. 다만, 모델이 커짐으로써 연산량 증가가 불가피하다. 이를 해결하고자 CNN 모델의 불필요한 가중치를 제거하는 방법들이 연구되고 있다. 이전 survey 논문에서 언급했다 싶이 다양한 메소드가 존재한다. 본 논문은 그중에서 Filter pruning 방법을 채택하고 있으며, soft pruning 방법을 제시하고 l2-norm을 기준으로 importance를 estimate 한다. 본 논문 이전 연구에서는 Hard filter를 활용한 방법이 많이 활용되었다. 하지만 이 방법에는 (1) 모델 성능저하와 (2) pre-trained 모델에 대한 의존성이라는 두가..

[논문리뷰] Convolutional Neural Network Pruning: A Survey

1. Convolutional Neural Network Pruning CNN은 이미지 분야에서 다양하게 활용되고 있는 기본 모델이다. 모델의 성능을 높이기 위해 모델을 깊게 쌓거나 넓게 쌓는 등 크기를 증가 시키는 방향으로 연구가 진행됐다. 하지만 이에 따라서 모델이 학습해야 하는 파라미터 수가 많아졌고, 모바일이나 IoT 디바이스 등 경량 디바이스에서는 활용하기가 어려워졌다. 이를 위해 성능 저하가 최소화할 수 있는 방향에서 모델의 크기를 줄이는 방법이 필요하다. 본 논문에서는 CNN에서 Pruning하는 방법과 학습 Strategy, 그리고 Estimation Criterion에 대해서 설명한다. 2. Pruning Method Pruning Method는 1) Non-Structured Pruni..

쉽게 설명하는 엔트로피(Entropy) 개념

엔트로피(Entropy)의 정의 엔트로피는 물질이나 시스템의 무질서함이나 혼란도를 나타내는 물리적, 그리고 정보이론적 개념이다. 열역학에서는 일반적으로 물질의 무질서함이나 에너지의 확산정도를 나타낸다. 정보 이론에서는 데이터의 불확실성을 측정하는 값이다. 엔트로피가 높다는 것은 불확실성이 높다는 것을 의미한다. 우리는 인공지능에서의 엔트로피를 말하기 위해 정보이론에서의 엔트로피를 다루도록 한다. 정보 이론에서 엔트로피는 샤넌 엔트로피(Shannon entropy)[1]로 불리기도한다. 샤넌 엔트로피는 확률 분포를 사용하여 불확실성의 정도를 측정하는데, 이산 확률 분포에 대한 샤넌 엔트로피는 다음과 같이 나타 낼 수 있다. $$ H(X) = -\sum P(X) log_2P(X)$$ 여기서 $H(X)$는 확..