[EDB 엔지니어링 뉴스레터 #2]: PostgreSQL·데이터·AI 최신 동향
2025년 1월 7일
EDB 엔지니어링 뉴스레터 제2호에 오신 것을 환영합니다. 이번 호에서는 EDB 엔지니어링 팀이 주목한 데이터 분야의 흥미로운 자료와 팀의 최신 소식을 소개합니다. Amazon S3 Tables와 Ollama·Hugging Face 통합부터 분산 데이터베이스의 시간 처리, PostgreSQL 성능 개선, CloudNativePG 및 커뮤니티 동향까지 살펴보세요.
EDB 엔지니어링 팀이 주목한 기술
새로운 Amazon S3 Tables: 분석 워크로드에 최적화된 스토리지
이는 AWS가 Iceberg 테이블 메타데이터를 플랫폼 수준의 일급 객체로 제공하고, s3tables CLI와 AWS 웹 플랫폼 콘솔을 통해 관리할 수 있게 한 것으로 볼 수 있습니다. 관리 범위에는 CRUD와 압축(compaction) 같은 테이블 유지 관리가 포함됩니다. 다만 이러한 테이블 버킷의 실제 데이터 수집, 사용 및 처리는 EMR, Redshift, Glue, Athena, Data Firehose 같은 다른 AWS 서비스를 통해 이뤄집니다.
https://aws.amazon.com/blogs/aws/new-amazon-s3-tables-storage-optimized-for-analytics-workloads
Ollama에서 Hugging Face Hub의 GGUF 모델 사용하기
이제 Ollama는 Hugging Face Hub와 통합되어 공개 및 비공개 GGUF 모델을 사용할 수 있습니다. GGUF는 모델을 빠르게 불러오고 저장하도록 최적화된 바이너리 형식으로, 추론 작업에 매우 효율적입니다. 이 통합으로 별도의 설정 없이 단일 명령어로 모델을 실행할 수 있어 과정이 간소화됐으며, Ollama의 인기는 더욱 높아질 것으로 보입니다.
https://huggingface.co/docs/hub/en/ollama
분산 데이터베이스에서의 시간 활용: 1~3부
Murat Demirbas는 신뢰할 수 없는 네트워크와 시계 하드웨어 환경에서 분산 데이터베이스가 시간을 처리하는 이유와 방법을 다룬 훌륭한 연재 글을 작성했습니다. 논리 시계와 벡터 시계부터 NTP, Clock SI 같은 주요 현대적 설계, Dynamo와 Spanner 같은 프로덕션 시스템까지 중요한 역사적 배경을 설명합니다.
- 1부: https://muratbuffalo.blogspot.com/2024/12/use-of-time-in-distributed-databases.html
- 2부: https://muratbuffalo.blogspot.com/2024/12/use-of-time-in-distributed-databases_26.html
- 3부: https://muratbuffalo.blogspot.com/2024/12/use-of-time-in-distributed-databases_30.html
효과적인 AI 에이전트 구축하기
이 글은 에이전트와 워크플로가 무엇인지 설명하는 데 그치지 않고, LangChain 같은 주요 프레임워크로 이를 구축하는 방법과 시스템 설계 시 참고할 수 있는 여러 아키텍처를 소개합니다. Simon Willison이 작성한 이 글의 리뷰도 흥미롭게 읽었습니다.
https://www.anthropic.com/research/building-effective-agents
PostgreSQL 튜플 디포밍 성능 개선
David Rowley는 PostgreSQL 튜플을 더 빠르게 ‘디포밍(deform)’하기 위한 일련의 패치를 개발하고 있습니다. 디포밍은 튜플 데이터를 셀의 values와 셀의 isnull 불리언 값을 담는 별도 배열로 추출하는 과정입니다. “제 테스트에서는 약 5~20%로 성능 향상이 상당히 좋아 보입니다.”
DataFusion 44의 다중 열 GROUP BY 개선
이전 릴리스인 DataFusion v43에서는 여러 열을 기준으로 그룹화할 때 열 형식에서 행 형식으로 변환하지 않도록 하는 중요한 개선이 이뤄졌습니다. 예를 들면 SELECT ... FROM ... GROUP BY col1, ... colN과 같은 쿼리입니다. 이 변경은 col1, …, colN의 데이터 유형에 특화된 코드를 사용했습니다.
v44에서는 시간 관련 유형이 포함된 여러 열을 기준으로 그룹화할 때의 지원이 개선됐습니다. 다중 열 GROUP BY에서 추가(append) 및 같음(equal to) 연산자를 위한 벡터화 연산도 개선됐습니다.
전체 v44 릴리스 노트는 여기에서 확인할 수 있습니다.
PostgreSQL과 Fil-C
Filip Jerzy Pizło는 일련의 Twitter 게시물을 통해, 메모리 안전성을 갖춘 Clang 포크인 Fil-C로 PostgreSQL을 빌드하기 위한 진행 상황을 공유했습니다. Fil-C는 이미 코드를 변경하지 않고도 OpenSSH와 Lua 같은 다른 주요 프로젝트를 빌드할 수 있었습니다. 그는 PostgreSQL이 사용하는 흥미롭지만 안전한 여러 기법을 발견했으며, Fil-C가 이러한 기법을 인식하도록 업데이트하고 있습니다. PostgreSQL의 버그를 하나 발견했을 가능성도 있습니다.
Andrew Ng이 살펴본 AI 에이전트와 에이전틱 추론의 부상
https://www.youtube-nocookie.com/embed/KrRD7r7y7NY?rel=0&autoplay=0&showinfo=0&enablejsapi=0
Andrew Ng은 ‘에이전틱 AI(agentic AI)’의 혁신적 잠재력을 강조했습니다. 그는 AI 에이전트가 사람의 문제 해결 방식처럼 반복적으로 계획하고 행동하며 해결책을 개선하는 패러다임이라고 설명했습니다.
또한 프로토타이핑을 가속하는 생성형 AI의 역할과, 비즈니스 성과를 위해 텍스트·이미지·동영상 같은 비정형 데이터를 활용하는 방향으로의 전환을 강조했습니다.
Ng은 성찰(reflection), 도구 사용, 멀티 에이전트 협업 같은 주요 설계 패턴과 복잡한 시각적 작업을 처리할 수 있는 대규모 멀티모달 모델(Large Multimodal Model, LMM)의 발전을 언급했습니다.
마지막으로 책임 있는 개발, 비정형 데이터를 처리하는 데이터 엔지니어링, 새롭게 등장하는 AI 애플리케이션의 중요성을 강조하며 지금을 AI 개발자에게 중요한 전환점으로 제시했습니다.
EDB 팀의 최신 소식
PostgreSQL의 순수 파서와 재진입 가능 스캐너
Peter Eisentraut는 PostgreSQL의 파서를 스레드 안전(thread-safe)하게 만들기 위한 일련의 패치를 개발하고 있습니다. 코드를 더 깔끔하게 만드는 것뿐 아니라, 향후 커뮤니티가 스레드 모델로 전환하기로 결정할 경우 PostgreSQL의 전환을 가로막는 장애물 하나를 제거합니다.
https://www.postgresql.org/message-id/flat/eb6faeac-2a8a-4b69-9189-c33c520e5b7b%40eisentraut.org
Kubernetes와 CloudNativePG를 활용한 클라우드 중립적 Postgres 데이터베이스
CloudNativePG를 사용하면 조직은 선언적 구성을 기반으로 베어메탈, 하이브리드 또는 멀티 클라우드 환경 전반에서 PostgreSQL 클러스터를 실행하는 견고하고 고성능이며 표준화된 방식을 도입할 수 있습니다. 이를 통해 DBA는 데이터와 성능을 완전히 통제하면서 공급업체 종속을 피하는 클라우드 중립적 비공유(shared-nothing) 아키텍처를 구현할 수 있습니다. 기업이 클라우드 의존형 모델에서 벗어나는 흐름이 커지는 가운데, CloudNativePG는 온프레미스 환경으로의 복귀를 포함해 다양하고 복잡한 환경에서 PostgreSQL을 관리할 수 있는 확장 가능하고 미래 지향적인 솔루션을 제공합니다.
Postgres Hacking Workshop: 2025년 1월
Robert Haas는 매월 열리는 온라인 모임인 PostgreSQL Hacking Workshop을 주최합니다. 참가자들은 기존 PostgreSQL 발표를 시청하고 함께 토론합니다. 경험이 풍부한 PostgreSQL 기여자와 PostgreSQL을 처음 접하는 사람들이 두루 참여합니다. Robert는 “매달 꾸준히 참석하는 경험 많은 분들이 있어 정말 큰 행운입니다. 하지만 진정한 목표는 더 많은 사람의 참여를 돕는 것이므로 새로운 분이 통화에 들어오는 모습을 볼 때마다 늘 반갑습니다”라고 말했습니다. PostgreSQL 기여 경험과 관계없이 시간이 된다면 PostgreSQL Hacking Workshop을 확인해 보세요.
https://rhaas.blogspot.com/2024/12/postgresql-hacking-workshop-january-2025.html
PostgreSQL 17.1의 ABI 호환성 문제 설명
지난 호에서는 Pavan Deolasee가 PostgreSQL 17.1의 애플리케이션 바이너리 인터페이스(Application Binary Interface, ABI) 호환성 문제를 처음 발견한 메일링 리스트 링크를 공유했습니다. Pavan은 무엇이 잘못됐는지 더 자세히 다룬 후속 블로그 글을 작성했습니다.
https://www.enterprisedb.com/blog/explaining-abi-breakage-postgresql-171
EDB 엔지니어링 뉴스레터 FAQ
EDB 엔지니어링 뉴스레터 제2호에서는 어떤 주제를 다루나요?
Amazon S3 Tables, Ollama와 Hugging Face Hub, 분산 데이터베이스의 시간 처리, PostgreSQL 튜플 성능 개선, DataFusion 44, AI 에이전트 등을 다룹니다. EDB 팀의 PostgreSQL 파서 개선, CloudNativePG, 커뮤니티 워크숍 및 PostgreSQL 17.1 ABI 소식도 포함합니다.
Amazon S3 Tables의 데이터 처리는 어디에서 이뤄지나요?
테이블 메타데이터와 CRUD, 압축 같은 유지 관리는 s3tables CLI와 AWS 콘솔에서 관리할 수 있습니다. 실제 데이터 수집, 사용 및 처리는 EMR, Redshift, Glue, Athena, Data Firehose 같은 AWS 서비스를 통해 이뤄집니다.
Ollama에서 Hugging Face Hub의 GGUF 모델을 사용할 수 있나요?
네. Ollama는 Hugging Face Hub와 통합되어 공개 및 비공개 GGUF 모델을 사용할 수 있습니다. 이 통합을 통해 별도의 설정 없이 단일 명령어로 모델을 실행할 수 있습니다.
PostgreSQL 튜플 디포밍이란 무엇인가요?
튜플 데이터를 셀의 values와 isnull 불리언 값을 담는 별도 배열로 추출하는 과정입니다. 소개된 패치의 작성자는 자신의 테스트에서 약 5~20%의 성능 향상을 확인했다고 밝혔습니다.
CloudNativePG는 어떤 환경에서 PostgreSQL을 운영할 수 있나요?
CloudNativePG는 선언적 구성을 기반으로 베어메탈, 하이브리드 및 멀티 클라우드 환경에서 PostgreSQL 클러스터를 운영하는 방식을 제공합니다. 소개된 글은 온프레미스 배포를 포함한 다양한 환경에서의 클라우드 중립적 운영을 설명합니다.
다음 뉴스레터에서 만나요
EDB 엔지니어링 뉴스레터 제2호가 유익했기를 바랍니다. 커뮤니티 활동에 참여하려면 PostgreSQL Hacker Mentoring Discord 참여를 고려해 보세요.
EDB Engineering Team









