| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- diffusion transformer
- AI
- vibe coding
- 이미지 생성
- 메타
- 생성형AI
- gaussian splatting
- 인공지능
- 딥러닝
- 멀티모달
- 이미지 편집
- 단일HTML
- 감정 표현
- 오블완
- PYTHON
- AI 기술
- 오픈소스
- OpenAI
- 일론 머스크
- 강화학습
- 음성합성
- 확산 모델
- tts
- 바이브코딩
- 우분투
- 티스토리챌린지
- 트랜스포머
- LLM
- 오픈AI
- 자동화
- Today
- Total
목록전체 글 (986)
AI 탐구노트
Github을 이용해 코딩을 할 때 main 브랜치 이외에 다른 브랜치를 만들어 main 코드에 영향을 주지 않고 작업을 진행한 다음 main 에 병합하거나 할 수 있습니다. 제 경우, 수정사항을 pull request로 병합하지 않고, 결이 다른 작업이나 테스트에 이를 활용할 때가 있습니다. 애초에 병합을 목적으로 하지 않는 경우가 되는거죠. 이런 경우, Github Repository에 등록된 브랜치 들 가운데 특정한 것만 내려받을 수 있고, 이 기능을 가끔씩 사용하고 있는데... 문제는 커맨드를 자꾸 까먹어서 '검색->사용->망각' 루프를 계속 돌리고 있다는 것입니다. 그래서, 이번엔 아예 블로그 글에 등록해두고 이걸 확인하는 방식으로 진행하려고 합니다. 1) 기본 브랜치를 복제한 후 특정 브..
Qwen3-ASR 모델을 이용해 오디오를 실시간 전사(Transcribe) 하는 앱을 만들어 봤습니다. 예전에는 Web Speech API나 Whisper 등을 이용해서 이런 작업을 많이 했었는데 성능은 좋은데 속도가 느리다는 단점이 있었습니다. 그런데 새로 나온 Qwen3-ASR은 Whisper 대비 10배 정도 빠르다는 풍문(?)이 있었고 저는 확 낚여버렸습니다. 참고로 Qwen3-ASR은 1.7B, 0.6B 이렇게 2개의 weight가 공개되어 있습니다. 1.7B 모델이 아무래도 성능은 좋습니다. ASR 모델 + KV Cache 공간하면 대략 10GB 정도(최소는 7GB 가량?) 사용하는 것 같습니다. 1. 구성 입력할 음성 스트리밍은 마이크를 이용하거나 혹은 Youtube 오디오를 이용할 수..
이번에 만들어 본 것은 3D 포켓볼 게임입니다. 볼링과 함께 심심할 때 남는 시간을 때우기 위해 한번씩 열어서 해 보는 게임이죠. 1. 게임 개요2인용으로 플레이할 수 있는 3D 웹 포켓볼 게임입니다. 2. 게임 특징사람 플레이어 2명이 하는 것으로 가정을 해서 룰은 간단한 포켓볼 룰만 적용되어 있습니다. 설정에서 다음을 지원합니다. 게임에서 사용하는 색공의 수(4~15개)나 크기(0.018:공식크기~0.28)는 변경 가능마찰 계수, 최대 샷 세기, 포켓 크기 등도 설정에서 변경 가능샷을 하고 나서 볼이 완전히 멈추면 자동을 현재 흰볼의 위치를 기준으로 화면이 정렬됩니다.화면은 카메라 시야 조절을 통해 줌과 회전이 지원됩니다. 3. 게임 구현단일 HTML로 구현되어 있습니다. Three.js를 이..
Docker 컨테이너를 만들고 테스트를 하다가 자기도 모르는 사이에 그대로 두는 경우가 있습니다. 그러다 어느 날 컴퓨터를 켰는데 GPU VRAM을 잔뜩 잡아 먹고 있는 녀석을 보게 됩니다. 아... docker 이미지를 생성하고 이를 실행하면 컨테이너가 기본적으로 자동으로 시작하게 된다는 것을 까먹은거죠. 이럴 때 Docker container의 자동 재시작을 비활성화 하도록 하는 커맨드를 알아 두면 편리합니다.# 단일 컨테이너 자동 재시작 끄기docker update --restart=no [컨테이너_이름_또는_ID]# 모든 도커 컨테이너 자동 재시작 끄기docker update --restart=no $(docker ps -a -q) Docker container 한번에 다 종료하기docker ..
다리오 아모데이의 인터뷰 Antropic의 CEO인 다리오 아모데이가 CNN과의 인터뷰에서 직설적으로 현재의 AI 개발 속도를 늦춰야 한다는 얘기를 했습니다. 최근 AI가 차세대 AI 개발을 돕는 ‘재귀적 자기개선’ 단계에 들어서며, 인간의 이해·통제 능력을 앞지를 수 있다고 봤기 때문입니다. 그러면서 그는 이를 위한 해법 3가지를 다음과 같이 언급했습니다.외부 안전평가기관이 직원 수준으로 상시 접근하는 내재형 독립 평가자 제도민주주의 국가만이라도 우선해서 선도 AI 기업의 공통 안전기준·속도 제한 협력 중국 등 권위주의 국가와도 검증 가능한 국제 안전협약 모색 갑자기? 어떤 계기가 있었나? 이 얘기의 직접적인 계기는 최근 OpenAI의 AI 에이전트가 Hugging Face를 해킹한 사건이며, 이때 ..
대규모 언어 모델의 성능을 높이는 가장 익숙한 방법은 더 많은 데이터를 모으고, 그 데이터로 다시 학습하는 것입니다. 하지만 모델이 커질수록 필요한 데이터의 양과 품질도 함께 높아집니다. 특히 수학, 코딩, 전문 지식처럼 어려운 영역에서는 사람이 만든 고품질 문제와 답을 계속 확보하는 일이 만만치 않습니다. 그래서 최근에는 모델이 스스로 학습할 문제를 만들거나, 합성 데이터를 이용해 학습 재료를 늘리는 방식을 도입하는 경우가 등장하고 있습니다. 이번에 소개할 논문에서는, 이미 존재하는 학습 데이터를 변형하는 대신, 언어 모델 자체가 '문제를 내는 역할'과 '문제를 푸는 역할'을 번갈아 맡도록 합니다. 문제를 내는 쪽은 상대가 풀기 어려운 질문을 만들고, 문제를 푸는 쪽은 그 질문에 더 잘 답하도록 학습합..
이번에는 엘리베이터 추적 게임을 만들어 봤습니다. 그런데 만들고 나서 아이에게서 혹평을 들었습니다. 재미없다고... -_-; 아프지만 그래도 의미있는 피드백입니다!!!사실 제가 생각하기에도 재미를 느낄려면 뭔가 다른게 있어야 하는데 싶을 정도로 뭔가 빠졌다는 느낌을 받게 됩니다. 1. 게임 개요건물 내에서 엘리베이터를 타고 이동하며 형사가 범인을 쫓아가서 잡는 웹 게임입니다. 플레이어가 형사가 되고 범인은 AI(알고리즘)으로 되어 있습니다. 법인은 본능적으로(^^;.. 실은 형사와의 거리 등을 실시간으로 판단해) 형사를 피해 다니도록 되어 있습니다. 2. 게임룰형사가 범인과 마주쳐 잡으면 끝나는 간단한 룰만 가집니다. 건물에는 5~8층, 3~4개의 라인의 엘리베이터가 있고 엘리베이터마다 각각 서는 ..
Edge0은 전체 MoE 모델을 SSD에 두고 필요한 전문가 가중치만 미리 읽어 메모리에 올리는 방식으로, 대형 모델을 낮은 활성 메모리에서 실행하게 하는 오픈소스 온디바이스 추론 프레임워크입니다. 범용 모바일 프레임워크라기보다는 현재까지는 Apple Silicon Mac에서 대형 희소 MoE를 SSD 스트리밍으로 돌리는 초기 프리뷰 정도라고 할 수 있습니다. (단... iOS, Android도 따로 진행되고 있는 것 같습니다.) 쉽게 얘기하면 SSD에 모델을 저장해두고 mmap (메모리 매핑 기술)으로 접근하고, 필요한 매개변수만 로드해서 처리하는 방식이라고 할 수 있습니다.핵심 구조대상 모델 : edge0-35b는 Qwen3.5-MoE 35B-A3B 기반, 40개 레이어, 256개 전문가 중 토큰마다..
Marigold V2는 이미지 생성용 DiT를 단일 이미지 깊이 추정기(Depth Estimation)로 전환한 모델입니다. 특히 머리카락, 철망, 나뭇잎처럼 얇은 경계의 깊이를 더 선명하게 복원하는 데 초점을 둡니다. 공개된 영상을 보면 정말 머리카락 한 올 한올의 깊이가 선명하게 구분되는 것을 알 수 있습니다. 정말 좋아보이는데... 아쉽게도 너무 무겁다는... 그래도 짤막하게 기록해 놓고 가겠습니다. 1. 핵심 특징입력 : RGB 이미지 1장출력 : 상대 깊이(affine-invariant log depth). 즉, 장면 내부의 선후 관계는 알 수 있지만, 실제 거리는 바로 얻지 못함기반 모델 : Qwen-Image-Edit-2509 이미지 편집용 Diffusion Transformer(DiT..
AI 관련 뉴스'GPU 8496장' 슈퍼컴퓨터 한강, 12월 가동...세계 TOP 10 기대 (머니투데이) : KISTI(한국과학기술정보연구원) 내 국가 슈퍼컴퓨터 6호기 (한강)이 공식 가동됨구글클라우드 “TPU 사업 규모, 경쟁사의 2배”… 외부 판매 확대 (조선비즈) : TPU(구글) vs 트레이니엄(아마존), 마이아(MS) 비교"이럴 거면 내가 챗GPT에 묻지"…회사에 늘어난 '미트 프록시', 혹시 나도? (주간조선) : 미트 프록시(Meat Proxy) : AI가 생성한 내용을 검증없이 다른 사람에게 그대로 전달하는 사람을 뜻하는 신조어AI 영상 생성 난제 풀었다…카카오, 신기술 ‘KATok’ 공개 (디지털타임즈) :영상 프레임 중복성에 주목해서 움직임 복잡도와 정보량에 따라 토큰 배분을 동적..
