| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- 생성형AI
- 음성합성
- tts
- 오픈소스
- 바이브코딩
- 티스토리챌린지
- ChatGPT
- 일론 머스크
- 오블완
- LLM
- OpenAI
- PYTHON
- AI 기술
- 트랜스포머
- 이미지 편집
- 감정 표현
- 오픈AI
- 딥러닝
- 멀티모달
- 인공지능
- 강화학습
- 이미지 생성
- gaussian splatting
- 자동화
- 우분투
- diffusion transformer
- vibe coding
- 메타
- AI
- 확산 모델
- Today
- Total
목록전체 글 (967)
AI 탐구노트
지난 번 AI 회의록이 필요로 하는 기능을 조사해서 정리했었습니다. 실제 회사 업무에서 꼭 필요로 할만한 것들이 다수 있었는데, 그 가운데 가장 기본되는 것들만 추려서 프로토타이핑을 해 보기로 했었습니다. (링크) 당시 구현해 볼 기능으로 적은 것은 다음과 같습니다. 회의 내용이 자동으로 녹음 -> 음성파일(mp3/wav)로 저장음성파일을 전사 및 화자 분리(transcribe & diarize) -> 회의록 원본 생성회의록 원본 내용을 LLM으로 요약해서 회의록 요약본을 생성 -> Markdown 타입 혹은 간단한 템플릿 타입회의 결과 페이지를 생성합니다. (회의음성 파일 + 회의록 원본 스크립트 + 회의록 요약본 내용)회의 결과 페이지 URL을 참석자들의 메일로 발송 최종 결과물 1️⃣ 회의록 생..
최근 기업들에서는 AI를 이용해 회의 내용을 자동으로 요약하고 이를 업무 생산성을 향상 시키는 용도로 많이 활용하고 있습니다. 그런데... 실제로 본 적은 없어서 실제로는 어떤 기능들이 있을까 궁금해졌습니다. 그래서, 조사해서 정리를 해 봤습니다. 1. AI 회의록 앱이 가지는 일반적인 기능들실시간 음성인식회의 내용을 자동으로 텍스트로 변환 (전사:transcribe)다국어 지원전문용어, 사내용어 등 사용자 사전 지원화자 분리누가 어떤 발언을 했는지 자동 구분참석자 이름과 화자 매칭자동 요약 : LLM 이용해 요약 진행함전체 회의 내용 요약핵심 논의사항, 결정사항, 이슈 및 쟁점 별도 정리Action 아이템 자동 추출해야 할 업무, 담당자, 완료 기한주제 별 회의록 구성긴 회의를 안건 별로 자동 분할..
LightOnOCR2라는 모델이 공개됐습니다. 한동안 관심을 두지 않고 있다가 이번에 나온 건 어느 정도 성능일까 궁금해서 한번 돌려봤습니다. 테스트를 해 본 모델은 LightOnOCR2 1B 수준의 VLM 입니다. 대상은 예전 자동차 번호판의 텍스트 인식이구요. 물론 주행 영상이나 주차장 영상 등에서 실제 차량에 장착되어 있는 것을 가지고 하면 더 좋겠지만, 최근 사이트에 공개된 사진들은 대부분 번호판이 비식별화되어 있어서 그것을 이용할 수는 없었습니다. 그래서, 이미지는 구글링해서 번호판 부분만 샘플로 열거된 것을 하나 구했습니다. (아래 첨부 이미지) 차량에서 번호판이 추출된다고 가정하고 진행하는 것인데, 생각보다 아주 훌륭하게 나오는 것 같습니다. (특히 한글도...) 시간이 되면 좀 더 다양한..
실시간 사람 & 노인 낙상 감지 (Real-Time Person & Elderly Fall Detection) 기술이 공개된 것이 하나 있어 소개할까 합니다. Github 저장소는 다음과 같습니다. GitHub - AwaisShah75/Real-Time-Person-Elderly-Fall-Detection-SystemContribute to AwaisShah75/Real-Time-Person-Elderly-Fall-Detection-System development by creating an account on GitHub.github.com 이 프로젝트는 카메라 영상에서 사람, 특히 고령자의 낙상(Fall)을 실시간으로 감지하기 위한 컴퓨터 비전 시스템으로 개발되었습니다. 단순히 사람이 누워 ..
사용 중인 갤럭시 스마트폰에서 저장공간이 부족해져서 사진을 백업해야 하는 상황이 발생했습니다. 추가 장착한 SD가 있어서 별 생각없이 마구 영상이나 사진을 찍어댔는데 그게 문제였던 겁니다. (참고로 제 폰은 구형 보급형 모델 입니다.) 최종적으로 하려는 것은 사진파일의 백업이고, 할 때마다 처음부터 다시 할 수는 없으니 이전에 백업했던 사진들은 제외하고 새로 찍은 것만 추가로 백업되도록 하는 것입니다. 절차는 다음과 같습니다. 1. 스마트폰과 PC 연결하기스마트폰과 PC를 USB 데이터 케이블로 연결합니다. (전원 전용 케이블이 아닌지 확인 필수!)리눅스의 경우, 연결하면 다음과 같이 나왔습니다. 파일시스템의 속성이 Mtpfs로 되어 있죠. 2. 스마트폰의 사진 폴더 찾기이제 스마트 폰에서 사진..
이번에는 방탈출 게임을 만들어 봤습니다. 실제 방탈출은 다양한 아이템, 시나리오, 탈출 방법들이 있을 겁니다. 이번에 구현해본 것은 그런 것들 가운데 아주아주 간단한 케이스 하나를 시험삼아 만들어 봤다고 생각하면 될 것 같습니다. 1. 방 탈출 게임이란?방탈출 게임은 제한된 시간 안에 현재 자신이 몸담고 있는 공간에 숨겨진 단서와 아이템을 찾고, 이를 이용해 퍼즐과 암호를 해결하여 최종 목표(탈출)를 달성하는 체험형 게임입니다. 관찰, 추리, 논리적 사고, 협동 등이 중요하며 미스터리/공포/모험 등 다양한 스토리와 테마로 구성되어 있습니다. 한때 (어쩌면 지금도?) 워낙 인기여서 주변 사람들 가운데 경험자가 다수 있었는데 한번 가본 사람은 없었습니다. 약간 중독성이 있지 않을까 싶은 생각도 들었습니다..
혹시 예전에 엣지 장비에서 AI 모델을 구동시킬 때 사용하던 TensorFlow Lite라는 것을 들어보신 적이 있나요? 하긴 최근에는 AI 학습/추론 플랫폼이 Pytorch가 대세로 굳어서 초창기 TensorFlow의 이름조차 모르는 분들도 있을 것 같긴 합니다. LiteRT-LM은 Google AI Edge가 공개한 온디바이스 LLM 추론용 오픈소스 프레임워크로, 앞서 언급한 TensorFlow Lite를 기반으로 해서 스마트폰, PC, 임베디드 장치 등에서 LLM을 클라우드 없이 로컬 실행하는 것을 목표로 개발되었습니다. 1. 주요 특징주요 특징으로는 다음과 같은 것이 있습니다. 온디바이스 LLM 추론 최적화 : 네트워크 연결 없이 로컬에서 생성형 AI 실행 (개인정보 보호, 낮은 지연시간, ..
이번에 만들어 본 것은 공공칠빵 게임입니다. 요새도 하는지 모르겠지만 예전에는 MT만 가면 늘 하던 게임이었습니다. 추억의 게임이자 늘 걸릴까봐 전전긍긍하던 '떨림의 게임'이죠. 1. 공공칠빵 게임이란?공공칠빵(007빵) 게임은 여러 사람이 원을 이루어 앉아 순서대로 구호와 지목 동작을 빠르게 이어가는 게임입니다. 순발력과 집중력 이 고도로 요구되죠. 보통 4명 이상이 하게 되는데 정해진 순서와 동작을 실수하지 않고 빠르게, 빠르게, 빠르게 이어나가는 것이 중요합니다. 이 '빠름'의 속도가 뇌 속에서 상황 정리를 하는 속도보다 빠르면 지는 게임인거죠. 이번에 구현한 게임은 참가자 5명인 1인용 게임입니다. 즉, 1명 (나)를 제외한 나머지는 다 AI(혹은 로직)이라는 의미입니다. 2. 게임룰한 사라..
이번에는 전통 게임 가운데 하나인 고누게임을 만들어 봤습니다. 아무래도 우리 것은 소중하니까요! (다만, 전통게임 종경도의 구현은 모바일에서는 한자/글자가 너무 많고 복잡해서 모바일 작은 화면에서는 못할 것 같아 포기했습니다. -_-;) 1. 고누게임이란?고누게임은 말판 위에서 자신의 말을 움직여 상대방의 말을 잡거나 움직이지 못하게 만들면 이기는 우리나라 전통 게임입니다. 2인이서 하는 전략 게임의 한 종류죠. 2. 특징말판 자체가 복잡하지 않고 룰도 단순해서, 종이에 그리거나 심지어 땅바닥에 그려서 하는 경우도 많았다고 합니다. 승리조건 : 상대 말을 잡거나, 상대를 더 이상 움직이지 못하게 하면 승리합니다. 고누 종류 별로 둘 중 하나가 선택됩니다. 고누 종류는 매우 다양하며, 이 중에도 또..
1. MOSS Transcribe DiarizeMOSS Transcribe Diarize는 긴 다화자 음성을 한 번에 처리해 전사(transcribe) + 화자 분리(diarize) + 타임스탬프를 함께 출력하는 오픈소스 음성 이해 모델입니다. GitHub 기준 공개 모델은 MOSS-Transcribe-Diarize 0.9B이며, 긴 회의/인터뷰/팟캐스트/강의 같은 실제 음성을 대상으로 설계되었습니다. 게다가 Apache 2.0 라이선스를 따르고 있습니다. 2. 핵심 개념 기존 방식 : ASR 모델로 음성을 텍스트화 (STT) → Diarization 모델로 화자 구분 → 후처리MOSS 방식 : 하나의 멀티모달 LLM이 '누가, 언제, 무엇을 말했는지'를 한 번에 생성 이것을 SATS(Speaker-..
