You cannot select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
gesture_rec/utils/record_dynamic.py

87 lines
3.2 KiB
Python

import cv2
import numpy as np
import csv
import sys
import time
from pathlib import Path
import argparse
sys.path.append(str(Path(__file__).parent.parent))
from skeleton.mediapipe_detector import MediaPipeDetector
from ml_gestures.dynamic.feature_extractor import extract_sequence
def main():
parser = argparse.ArgumentParser()
parser.add_argument('--label', required=True, help='Название жеста (например, wave_left)')
parser.add_argument('--output', default='dynamic_data.csv', help='CSV файл для сохранения')
parser.add_argument('--camera', type=int, default=0)
parser.add_argument('--duration', type=float, default=3.0, help='Длительность записи (сек)')
args = parser.parse_args()
detector = MediaPipeDetector()
cap = cv2.VideoCapture(args.camera)
if not cap.isOpened():
print("Камера не найдена")
sys.exit(1)
# Определяем следующий ID последовательности
try:
import pandas as pd
df = pd.read_csv(args.output)
next_id = df['sequence_id'].max() + 1 if not df.empty else 0
except:
next_id = 0
print(f"Запись жеста: {args.label}. Нажмите SPACE для начала, q для выхода.")
recording = False
start_time = 0
sequence = []
while True:
ret, frame = cap.read()
if not ret:
break
frame = cv2.flip(frame, 1) # зеркало для удобства
result = detector.detect(frame)
if result['success']:
landmarks = result['landmarks']
vis = detector.draw_landmarks(frame, result['pose_landmarks'])
if recording:
sequence.append(landmarks)
elapsed = time.time() - start_time
if elapsed >= args.duration:
recording = False
# Сохраняем последовательность
seq_features = extract_sequence(sequence)
with open(args.output, 'a', newline='') as f:
writer = csv.writer(f)
for i, feat in enumerate(seq_features):
writer.writerow([args.label, next_id, i] + feat.tolist())
print(f"Сохранено {len(sequence)} кадров для жеста {args.label}, ID={next_id}")
sequence = []
next_id += 1
else:
vis = frame
if recording:
cv2.putText(vis, f"RECORDING... {elapsed:.1f}/{args.duration}", (10, 30),
cv2.FONT_HERSHEY_SIMPLEX, 0.7, (0,0,255), 2)
else:
cv2.putText(vis, f"Press SPACE to record '{args.label}'", (10, 30),
cv2.FONT_HERSHEY_SIMPLEX, 0.7, (0,255,0), 2)
cv2.imshow('Record dynamic gesture', vis)
key = cv2.waitKey(1) & 0xFF
if key == ord('q'):
break
if key == ord(' ') and not recording:
recording = True
start_time = time.time()
sequence = []
cap.release()
cv2.destroyAllWindows()
if __name__ == '__main__':
main()