| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- 확산 모델
- LLM
- 오픈AI
- 바이브코딩
- 일론 머스크
- 생성형AI
- 자동화
- PYTHON
- AI
- OpenAI
- 단일HTML
- vibe coding
- tts
- 우분투
- 오픈소스
- 이미지 생성
- 멀티모달
- 딥러닝
- 메타
- 음성합성
- diffusion transformer
- 티스토리챌린지
- AI 기술
- gaussian splatting
- 이미지 편집
- 웹게임
- 트랜스포머
- 강화학습
- 오블완
- 인공지능
- Today
- Total
목록전체 글 (1000)
AI 탐구노트
이미지, 영상, 편집 등 한가지 일이라도 한번쯤 해 보신 분들이라면 Adobe 의 소프트웨어 생태계를 무조건 접해 보셨을 거라 생각합니다. 대부분 사진 편집에서 Photoshop을 많이 사용하실테고 최근 유튜브 영상 제작에 프리미어를 쓰시거나 이것도 저것도 아니면 Adobe PDF Reader라도 사용해 보셨겠죠. 그만큼 이 분야에서 Adobe의 영향력은 막강합니다. 대부분 취업 시에도 그 도구들을 사용하는 것을 전제로 하고 있구요. 그런데 여기에는 한 가지 문제가 있습니다. 그것은 솔루션 구독료라 약간 사악하다는 것인데요... 흠... 직업적으로 쓰는 분 입장에서는 그렇지 않을 수도 있겠네요. 그렇지 않고 개인적인 용도로 사용하기에는 너무 비싸게 여겨지는 것이 사실입니다. 그래서, 가끔 이미지 편집 ..
구글 딥마인드가 지난 10월 6일, EmbeddingGemma 2를 공개했습니다. 기존 EmbeddingGemma가 텍스트 중심 임베딩 모델이었다면, 2세대에서는 텍스트/코드/이미지/영상/오디오를 하나의 벡터 공간에서 처리하는 멀티모달 임베딩 모델로 확장된 것이 가장 큰 변화라고 할 수 있습니다. 이번 글에서는 이 기술에 대해 간략하게 정리하고 가겠습니다. 1. 개요EmbeddingGemma 2는 740M 파라미터 규모의 오픈 가중치 멀티모달 임베딩 모델입니다. 텍스트, 코드, 이미지, 비디오, 오디오를 모두 공통 768차원 벡터 공간으로 변환합니다. 따라서 별도의 이미지 임베딩 모델, 음성 임베딩 모델, 텍스트 임베딩 모델을 각각 운영하지 않고도 서로 다른 데이터 간 의미 검색이 가능합니다. 예를 들..
이번에는 도둑잡기 게임입니다. 지난 번에 고누게임을 만들때 상대방의 말을 움직이지 못하도록 해서 승리하는 룰이 있었다는 것이 떠올랐습니다. 그렇다면 비슷하게 격자를 만들고 그 속에서 한쪽을 도둑, 한쪽을 경찰로 해서 게임을 진행하면 되겠다 싶었죠. 그런데... 이미 비슷한 게임이 시중에 많이 나와 있었습니다. 그래서 그쪽도 참고하고 해서 간단하게 만들어 봤습니다. 1. 게임 개요구성 : 도둑과 경찰, 인원 수는 설정에서 변경 가능목표 : 경찰을 배치하고 이동시켜 도둑을 체포하는 것게임판 : 선으로 연결된 지점들로 구성되며, 판마다 새로운 격자가 랜덤하게 생성됨. 격자 교차점 가운데 한 지점에는 도둑이 탈출할 수 있는 출구가 있음2. 게임룰경찰과 도둑이 한 턴씩 돌아가며 격자선 위를 이동합니다.경찰 ..
영상 생성 모델들이 너무 발전해서 최근에는 어떤 게 나오는지 별로 관심이 없었습니다. 가장 최근까지는 유튜브나 X에 올라오는 생성 영상들을 보면 거의 대부분 SeeDance 를 사용하고 있어서 거의 정리가 된 건가하는 생각이 들었습니다. 그런데 최근 LongCat-Video가 다시 뭔가를 내놓았습니다. 어떤 내용인지 한번 정리해 보겠습니다. 1.LongCat-Video란?LongCat-Video는 중국 Meituan(메이퇀)이라는 스타트업이 공개한 13.6B 규모의 오픈소스 비디오 생성 기반 모델입니다. 핵심 방향은 단순히 짧은 클립을 만드는 것이 아니라, 분 단위의 긴 영상을 품질과 시간적 일관성을 유지하면서 생성하는 데 있습니다. 연구팀은 이를 향후 World Model로 확장하기 위한 기반 기술..
예전에 아이가 MBTI 관련 책을 사서 보던 시기가 있어서 관련된 게임을 만들어 봤었습니다. 이번 글에서는 그 당시 만들었던 MBTI 판별기 및 퀴즈 프로그램을 소개하겠습니다. 1. 게임 개요성격 유형 검사인 MBTI를 테마로 한 웹 앱 콘텐츠(퀴즈 및 판별 프로그램) 입니다. 그래서 먼저 MBTI가 뭔지를 알아보고 가겠습니다. 1) MBTI(Myers-Briggs Type Indicator)란? MBTI는 마이어스(Myers)와 브릭스(Briggs)가 칼 융(Carl Jung)의 심리 유형론을 바탕으로 개발한 자기보고식 성격 유형 지표입니다. 사람이 세상을 인식하고 판단할 때 나타나는 선천적인 행동 경향을 4가지 상반된 지표로 분류하여 총 16가지 성격 유형으로 나타냅니다. 2) MBTI를 ..
일식/월식 시뮬레이터를 간단히 만들어봤습니다. 실제 태양, 지구, 달의 공전 궤도를 이용하면 되는 간단한 응용이라 간단할 것이라 생각했었습니다. 그런데, 정작 이상한 오류가 발생하는 바람에 그걸 푸느라 다른 경우보다 시간은 배로 든 것 같습니다. T^T 1. 개요일식/월식의 원리를 알 수 있게끔 만든 간단한 웹 시뮬레이터입니다. 태양, 지구, 달의 위치에 따라서 어떻게 보일지를 달이나 지구를 드래그해서 공전궤도 상에서 움직여가면서 확인할 수 있도록 했죠. 개발 목적은 아이에게 일식과 월식의 원리를 간단히 보여주기 위한 것입니다. 요새 초등학교에서는 공과 조명을 가지고 직접 실험을 한다는 것을 알았다면 만들지 않았을 겁니다. 2. 구현 방식일식, 월식을 구분해서 보여줌태양과 달의 표면 이미지를 생성하고 ..
대규모 언어 모델은 이제 몇 개의 예시만 보고 문제를 푸는 수준을 넘어서 수백 개에서 수천 개의 예시를 프롬프트에 넣고 활용하는 방향으로 발전하고 있습니다. 이를 'Many-shot In-Context Learning'이라고 합니다. 별도의 모델 학습 없이 많은 예시를 참고할 수 있기 때문에 분류나 수학 추론처럼 복잡한 문제에서 성능을 높이는 데 유용합니다. 하지만 참고할 예시가 많아질수록 모델이 기억해야 할 중간 데이터도 함께 늘어나는 문제가 생깁니다. 특히 긴 문맥을 처리하는 LLM에서는 이 데이터가 GPU 메모리를 상당히 차지하게 되죠. 이때 중요한 것이 KV Cache입니다. KV Cache는 LLM이 이미 읽은 토큰의 정보를 다시 계산하지 않도록 저장해 두는 일종의 작업 메모리입니다. 문제는 ..
이번에 소개할 게임은 3D 볼링 게임입니다. 볼링은 모름지기 볼링장에서 해야 제대로 된 재미를 느낄 수 있죠. 하지만, 여전히 방안, 혹은 사무실에서 자투리 시간에 킬링 타임 용도로 웹 게임도 나름 괜찮습니다. 1. 개요멀티 플레이어 (1~4명) 용 3D 볼링 웹게임입니다. 2. 게임룰일반 볼링 게임의 룰을 그대로 따릅니다. 1~4명까지 각자 이름을 등록하고 할 수 있으며 턴제로 진행됩니다.게임 진행 중에 언제든 점수판을 확인할 수 있습니다. 3.게임 특징볼링공은 시작 시 좌우로 이동해서 시작 위치를 정할 수 있습니다. (실제 게임에서 사람 볼러를 생각하시면 됩니다)볼을 누르고 있으면 대략적인 방향 가이드가 표시되도록 되어 있지만, 기본적으로는 모바일에서 손가락 스와이프를 이용해 게임하도록 만들어졌습..
1. 불편한 점, 문제점 컨퍼런스나 국제 행사 같은 것을 가 보면, 중앙에 발표 자료가 보이고 양 옆 혹은 아래 쪽에 발표자의 내용을 전사(Transcribe)하거나 번역해서 캡션처럼 보여주는 경우가 많이 있습니다. 그런데, 이 경우, 원하는 화면 위치에 보여줄 내용을 배치하기 위해서는, 행사 전문 업체의 스크린 담당자가, 캡션을 제공하는 쪽의 HDMI 신호를 받아와서 이를 전문 소프트웨어를 통해 출력 위치를 잡는 경우가 대부분입니다. 그러다보니 이렇게 한번 확정이 된 위치는 발표가 진행되는 동안에는 바꾸거나 혹시라도 오류가 나더라도 고치기 어려운 경우가 많습니다. 발표화면 상에서 마우스 옮겨가며 뭔가를 해야하는 상황이 될테니까요... 그래서, 어떤 방법이 있나요?화면에 가상 모니터를 띄워두고, 내가 ..
최근 AI로 인해 사회가 급변하고 있죠. 그런데... 너무 빨리 모든 것이 변하다보니 생각을 정리하지 못하고 넘어가는 경우가 다반사인 것 같아 걱정까지 됐습니다. 그래서, 두런두런 그동안 해 왔던 생각들을 정리해 보기로 했습니다. 현황에 대한 생각AI 혁명은 실제하며 현재 진행형이다.추세는 학습에서 추론으로 전환되고 있다. 그렇다고 학습이 완전히 없어진 것은 아니다.AI 에이전트, 코딩 에이전트, AI 콘텐츠 분야 등 한 번의 답변이 아닌 긴 문맥과 반복 호출, 도구 사용, KV 캐시 등의 요구로 인해 사용자가 늘수록 연산과 메모리 사용량은 점점 더 커질 수 밖에 없다.AI 혁명은 오픈AI, 엔트로픽, 구글, 바이두, 알리바바와 같이 모델 및 서비스를 제공하는 기업들이 수요를 이끌고 있다.오픈AI, 엔..
