본문 바로가기

분류 전체보기

(179)
비전(Vision) 분야의 ‘챗GPT 모먼트’는 언제 올까? 작년에 좋은 기회로 AWS 사용자 모임에서 발표를 진행한 적이 있습니다. 당시 제가 맡아 개발했던 ‘스포키 야구 AI 하이라이트’ 프로젝트를 소개했는데요. 여러 복합적인 비전 AI 기술들을 연결해 실시간으로 야구 하이라이트 영상을 자동 생성하는 엔진이었습니다.당시에도 AI에 대한 열기는 지금 못지않게 뜨거웠고, 챗GPT와 같은 LLM은 사람들에게 이미 익숙해진 시기였습니다. 반면 비전 AI 분야는 비전 전공자가 아니라면 그나마 ‘YOLO’ 정도만 들어봤을 정도로 다소 생소한 영역이었죠. 그때 청중석에서 한 분이 이런 질문을 던지셨습니다.“제가 비전 분야는 잘 몰라서 그러는데, 혹시 비전 분야에도 자연어 처리의 챗GPT 같은 대표적인 범용 모델이 있나요?”그 당시에는 완벽히 답하지 못하고 얼버무렸던 이 질..
Meta의 Muse Code & Muse Spark 1.2 분석 TL;DR (요약) Meta Superintelligence Labs가 공개한 터미널 코딩 에이전트 Muse Code와 파운데이션 모델 Muse Spark 1.2의 상주형 백그라운드 에이전트, 재시작 안전 런타임, 비디오 시각 코딩 및 Terminal-Bench/DeepSWE 벤치마크 결과를 뜯어봅니다. 목차 1. 터미널 커맨드 한 줄, 상주하는 백그라운드 에이전트 2. 세션 내내 살아있는 백그라운드 에이전트와 재시작-안전 런타임 세션 지속형 비동기 에이전트 (Async B..
Qwen 3.8-Max 기술 분석: 2.4조 파라미터 MoE와 1M 컨텍스트로 프론티어 LLM과 맞서는 알리바바의 플래그십 TL;DR (요약) Alibaba가 전격 발표한 2.4조 파라미터 스파스 MoE 모델 Qwen 3.8-Max의 토큰당 95B 활성 구조, 1M 컨텍스트 윈도우, PaperBench 93.0점 벤치마크 및 Max급 최초 오픈가중치 공개 전략을 뜯어봅니다. 목차 1. 2.4조 파라미터, 활성 95B, 1M 컨텍스트 2. 2.4T MoE 아키텍처: 토큰당 95B만 깨우는 극한의 희소성 3. 네이티브 멀티모달 & 1M 컨텍스트 윈도우 ..
AI 데이터센터 필수재! 비상발전기 국내 1위 ‘GNC에너지’ 총정리 안녕하세요! 오늘은 AI 데이터센터 확대의 숨은 수혜주로 주목받고 있는 GNC에너지 기업 분석 정보를 가져왔습니다. 최근 시장 변동성이 큰 상황 속에서도 신고가를 기록하며 기관 투자자들의 높은 관심을 받고 있는 이유와 핵심 투자 포인트를 깔끔하게 정리해 드립니다. 원문 링크:https://youtu.be/MeCs8dJ28Z8?si=whE2KpoHpLORIMYy 1. 최근 증시 흐름 및 AI 섹터 동향 📈시장 변화: 코스피 대비 코스닥의 상대적 강세와 함께, AI 및 데이터센터 섹터는 어려운 시장 환경 속에서도 실적과 모멘텀에 기반해 신고가를 갱신하는 기업들이 등장하고 있습니다.SK하이닉스 & 엔비디아 관계: SK하이닉스의 HBM 단가 협상 이슈로 시장의 우려가 일부 있었으나, 이는 엔비디아로부터 GPU..
Qwen-UI-Agent 기술 분석: 모바일과 PC를 넘나드는 능동형 실환경 GUI 파운데이션 에이전트 TL;DR (요약) Alibaba MAI-UI 팀이 공개한 Qwen-UI-Agent의 하이브리드 GUI+CLI 액션 공간, AutoResearch 스타일 데이터 플라이휠, 10,000+ 병렬 샌드박스 100턴 온라인 RL 및 모바일/OSWorld 벤치마크 결과를 뜯어봅니다. 목차 1. 모바일 92.2%, 10,000개 병렬 샌드박스 2. 하이브리드 액션 공간: GUI 클릭과 CLI 코드를 한 턴에 묶는다 3. AutoResearch 데이터 플라이휠과 100턴 강화학습 ..
LFM2.5-2.6B 분석: 2.5GB 메모리에 에이전트를 통째로 넣은 Liquid AI의 온디바이스 모델 TL;DR (요약) Liquid AI가 공개한 2.6B 파라미터 온디바이스 에이전트 모델 LFM2.5-2.6B의 4단계 포스트트레이닝 파이프라인, 에이전트 RL 학습 아키텍처, CPU/GPU 추론 벤치마크를 뜯어봅니다. 목차 1. 2.5GB에 에이전트가 들어간다 2. 4단계 포스트트레이닝: SFT → 전문가 분화 → 증류 → 에이전트 RL 3. 벤치마크 심층 분석: 체급을 파괴한 에이전트 특화 성능 정량 ..
DiffusionGemma 기술 분석: 단일 H100에서 1,500 token/s를 달성한 구글의 텍스트 디퓨전 파운데이션 모델 TL;DR (요약) Google DeepMind가 공개한 오픈가중치 텍스트 디퓨전 LLM DiffusionGemma의 2단계 파인튜닝 파이프라인, 엔트로피 경계 디노이징 샘플러, 그리고 H100 단일 GPU에서 초당 1,500 토큰을 뽑아낸 벤치마크 결과를 뜯어봅니다. 목차 1. 포워드 패스 1회에 토큰 20개 2. 밑바닥부터 새로 만든 모델이 아니다 3. 확신 있는 토큰부터 먼저 확정한다 4. 속도 7배..
Frontis-MA1 & OpenMLE 분석: 재귀적 자기개선(RSI)을 위한 풀스택 AI4AI 오픈 시스템 TL;DR (요약) Frontis.AI와 칭화대가 공개한 머신러닝 엔지니어링(MLE) 기반 재귀적 자기개선(RSI) 풀스택 플랫폼 OpenMLE 및 메타 진화 에이전트 Frontis-MA1-35B의 원리, 원자적 진화 연산자, 탐색 하네스, 벤치마크 성과를 분석합니다. 목차 1. 연구 배경: RSI(재귀적 자기개선) 실증을 위한 테스트베드 2. OpenMLE 풀스택 아키텍처 및 4대 원자적 진화 연산자 2-1. 4대 원자적 프로그램 진화 연산자 (Atomic Evolutio..