| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 이미지 생성
- diffusion transformer
- 오픈소스
- 티스토리챌린지
- 자동화
- 멀티모달
- 딥러닝
- tts
- 일론 머스크
- AI 기술
- 감정 표현
- 바이브코딩
- 음성합성
- OpenAI
- 이미지 편집
- 우분투
- 오블완
- 강화학습
- AI
- gaussian splatting
- 트랜스포머
- 인공지능
- 생성형AI
- 오픈AI
- 메타
- PYTHON
- ChatGPT
- LLM
- vibe coding
- 확산 모델
- Today
- Total
목록전체 글 (976)
AI 탐구노트
awesome-gpt-image-2는 OpenAI의 GPT-Image-2를 안정적이고 반복 가능하게 활용하기 위한 프롬프트 엔지니어링/템플릿 라이브러리 같은 것입니다. 핵심 개념은 'Prompt as Code'입니다. 필요한 상황이 생기면 써먹기 좋을 것 같이 이번 내용도 기록해 두고 넘어갑니다. 1. 개요커뮤니티의 GPT-Image-2 생성 사례를 수집/분석해서 재사용 가능한 구조화 프롬프트로 정리한 오픈소스 프로젝트입니다. 현재 544개 이미지 생성 사례와 20개 이상의 산업용 프롬프트 템플릿을 제공합니다.단순 프롬프트 모음이 아니라 Agent/스크립트/자동화 시스템에서 사용할 수 있는 프롬프트 엔진을 지향하고 있습니다. MIT License로 공개되었습니다. 2. 핵심 기술 — Prompt as ..
철로 연결 게임을 만들어 봤습니다. 워낙 비슷한 게임이 많아서 저도 구색 갖추기를 해볼까 해서 한번 만들어 봤습니다. 1.개요철로연결 게임은 기차 레일을 채워넣는 게임입니다. 진행하는 기차가 전복되지 않도록 비어 있는 타일을 빠르게 채워 잇는 게임입니다. 2. 게임 룰이번 게임의 룰은 다음과 정리했습니다. 기차가 지나가야 하는 궤도는 랜덤하게 생성됩니다.기차는 레일 위를 일정한 속도로 움직이며기차는 지나가는 시점에 레일이 놓인 방향대로 진행합니다. 만약 타일이 없거나 진행하는 방향에 맞지 않으면 기차는 탈선하며 게임이 종료됩니다. 타일은 맨 아래 여분의 타일을 이용하거나 이미 지나온 곳의 타일을 가져와서 배치해도 됩니다. 3. 특징허술함을 사랑하라 - 실은 손에 편한대로... 위에 언급한 것처럼, ..
Generalist AI가 2026년 8월 공개한 GEN-1.5는 로봇이 새로운 물리 작업을 한 번의 시연만 보고 즉시 학습할 수 있도록 만든 로봇 파운데이션 모델입니다. 별도의 파인튜닝이나 추가 학습 없이도 몇 초짜리 시연을 컨텍스트에 넣으면 작업을 수행할 수 있다는 점이 핵심인데, 이런 모델이 있었나 싶고 발표 후 아직 세부적인 정보가 공개된 것은 아니라 긴가민가하게 됩니다. GEN-1.5의 특징물리적 프롬프팅 (Physical Prompting = One-shot 학습) : 3~12초 정도의 단일 시연 영상을 모델에 입력하여 별도의 사전 재훈련 과정없이 새 작업을 바로 수행할 수 있음멀티모달 모델 : 영상, 언어, 센서 정보, 로봇의 관절 상태 등을 입력으로 받아 100Hz 행동 궤적을 생성함. ..
지난 9월1일, World Labs라는 곳에서 Atlas라는 월드 모델을 공개했습니다. 공개된 데모 영상들은 아주... 쇼킹했습니다. 몇 대의 카메라만 가지고 이걸 이렇게나 자연스럽게 만들어낼 수 있다니... 하면서 감탄했죠. 오늘은 이 기술에 대해 짧막하게 조사, 기록해 두고 가겠습니다. 1. Atlas 모델 개요Atlas는 공간 지능(Spatial Intelligence)을 위한 차세대 월드 모델(World Model)입니다. 현실 또는 가상 공간을 생성, 복원, 시뮬레이션할 수 있는 범용 모델인 셈이죠. Atlas의 개발사인 World Labs의 공동 창업자 중 한 사람은 스탠포드 컴퓨터과학 교수이자, Google Cloud AI/ML의 수석 과학자였던 Fei-Fei Li(페이페이 리)가 있습..
X 글에 소개된 곳 가운데 Infographic 디자인이나 리포트 등을 작성할 때 사용할만한 리소스를 제공하는 곳이 있어 기록해 둡니다. GitHub - antvis/Infographic: 🦋 An Infographic Generation and Rendering Framework, bring words to life with AI!🦋 An Infographic Generation and Rendering Framework, bring words to life with AI! - antvis/Infographicgithub.com 1.개요Ant Group의 AntV 프로젝트에서 개발한 오픈소스 인포그래픽 생성·렌더링 프레임워크입니다. 일반적인 차트 라이브러리보다는 정보 구조를 시각적 스토리로 표..
사진 한 장에서 사물까지의 거리를 추정하는 단안 카메라 이미지 기반 깊이 추정 기술은 빠르게 발전하고 있습니다. 특히 Depth Anything 계열 모델은 새로운 장면에서도 비교적 안정적으로 깊이를 예측하고 있죠. 하지만 사진에서 잘 작동하는 모델을 영상에 그대로 적용하면 문제가 생깁니다. 프레임마다 예측이 조금씩 달라져 깊이 영상이 깜빡이는 것처럼 보이기 때문인데, 사람에게는 작은 변화처럼 보여도, 3D 공간을 이해해야 하는 시스템에는 큰 오차가 될 수 있습니다. 기존에는 이런 문제를 해결하기 위해 Optical Flow나 카메라 자세 정보를 사용하거나, 비디오 확산 모델을 깊이 추정에 활용하기도 했습니다. 하지만 추가적인 연산이 필요하고 긴 영상을 처리하기 어렵다는 한계가 있었습니다. Video ..
이번에는 해적 룰렛을 만들어 봤습니다. 1. 해적 룰렛 (Pop-up Pirate)해적 룰렛 게임은 칼을 꽂으며 해적이 튀어나오는 순간을 피하는 게임입니다. 한명씩 번갈아가면서 차례대로 통에 난 구멍에 칼을 하나씩 꽂는데 특정 구멍(매 게임마다 달라짐)에 칼이 꽂히면 해적이 튀어 오릅니다. 그 사람이 패배하는거죠. 대부분 오프라인에서 제품(통아저씨 룰렛 게임이라는 이름으로도 팔리는 듯)을 구입해서 하는 경우가 많죠. 여러 사람이 돌아가면서 하는 게임이라 매우 간단한 규칙임에도 불구하고 긴장감이 장난 아닙니다. 그래서, 누군가에게 벌칠을 주거나 밥사기 내기 등에 활용하기도 합니다. 방송에서는 런닝맨에서 자주 했었는데, 똥손/꽝손, 금손이 확실히 나뉘는 것을 볼 수 있었죠. 금손은 주로 지효씨, 똥손/꽝..
1. Minimax H3 Max 모델 개요 Minimax H3 Max는 MiniMax가 오픈 웨이트로 공개한 기본 모델을 fal.ai가 추가 학습(Post-training) 및 최적화를 해서, 빠른 생성 속도와 높은 프롬프트 준수율, 캐릭터/스타일 일관성, 네이티브 오디오까지 강화한 768p 영상 생성 모델입니다. 베이스가 되는 모델의 경우도, 높은 품질 때문에 센세이션했는데 H3 Max 모델의 경우, '실시간보다 빠른 영상 생성'이라는 놀라운 사실 때문에 사람들의 주목을 받고 있습니다. 카메라 영상을 단순히 보여주는게 아니라 생성하는 것인데 보여질 것보다 생성하는 것이 더 빠를 수 있을까? 이제껏 이런 모델은 없었다~~~ 싶습니다. 이 때문에 X에서는 이미 트위치나 Kick이라는 영상 스트리밍 플랫..
알림장을 만들어 봤습니다. 원래 이름은 '포스트잇 공유의 벽'이라고 했었다가 '얌전하게' 바꿨죠. ^^; 평소 생각하고 있던 내용이나 다른 사람들에게 알려야 할 일들을 어딘가에 기록하고 공유하는 것이 필요하다고 생각하고 있었는데, 이번 기회에 그런 것을 만들어 본 것이죠. 1. 알림장 개요알림장은 포스트잇을 붙인 메모판입니다. 임시로 기록했다가 다 되면 떼어낼 수 있는 메모장인 셈이죠. 목록 형태의 메모장은 많이 있죠. 온라인에서는 노션도 있고 로컬에서는 Obsidian도 있죠. 하지만, 보기 불편하고 아무래도 파일 쌓여 있는 느낌이 강해서 많은 문서를 관리할 때는 좋지만 간단한 메모에는 적절하지 않습니다. 그래서 대부분 PC 사용 중에는 포스트잇 용으로 만들어진 전용 어플이나 앱을 사용하게 마련입니..
사람의 움직임을 어느 방향에서든 자연스럽게 바라볼 수 있는 디지털 인간은 가상현실, 게임, 영화 제작뿐 아니라 로봇과 사람이 함께 움직이는 Embodied AI에서도 중요한 기술이 되고 있습니다. 문제는 이런 4D 콘텐츠를 만들려면 보통 사람 주변에 여러 대의 카메라를 설치하고 모든 카메라를 정확히 보정해야 한다는 점입니다. 10년 정도 전이었던가 싶은데, LGU+ 프로야구 앱이 나왔을 때 홈런이 나오면 타자 주위 360도 영상을 모바일 폰에서 볼 수 있었습니다. 당시 이 영상은 경기장 곳곳에 장착된 많은 수의 카메라 영상을 이용하는 방식이었죠. 그리고, 그 시점 근처였던 것 같은데 DDP (동대문 디자인 플라자)에서도 수십대의 카메라로 둘러싸인 소규모 스튜디오에서 사진을 촬영하고 그걸로 만들어진 3D..
