728x90 반응형 전체 글322 Whisper 음성 전사와 TTS 실시간 오디오 스트리밍 (3) 추가 실습 과제기본 실습을 완료한 뒤 별도의 Python 파일로 기능을 확장합니다. 두 과제의 코드는 앞 단계 파일에 이어 붙이는 조각이 아니라 각각 독립적으로 실행할 수 있는 완성본입니다. 같은 공통 가상환경과 .env를 사용하며, 실행 전에 발생할 API 요청 횟수와 오디오 재생 여부를 사용자에게 확인합니다. 과제 1. 전사 모델·힌트 품질 비교 보고서lab06\compare_transcriptions.py는 같은 녹음 파일을 세 조건으로 전사합니다. 첫 번째는 whisper-1 기본 조건, 두 번째는 Whisper 용어 힌트 조건, 세 번째는 현재 권장 일반 파일 전사 모델인 gpt-transcribe에 언어·키워드 문맥을 제공한 조건입니다. 결과를 서로 다른 텍스트 파일에 저장하고, 정답 스크립트.. 2026. 9. 1. Whisper 음성 전사와 TTS 실시간 오디오 스트리밍 (2) 핸즈 온 실습실습 목표짧은 과학 축제 준비 회의를 기본 조건과 품질 개선 조건으로 각각 전사하고, 검토한 전사문을 세 문장의 안내 브리핑으로 정리한 뒤 AI 생성 음성 고지를 표시하고 PCM 스트리밍으로 재생하는 AI 회의록 브리핑 스튜디오를 단계별로 완성합니다.각 Python 파일은 먼저 경로·환경 변수·입력을 검증하는 코드 조각을 작성하고, 이어서 API 요청·결과 검증·저장·오류 처리를 추가하는 순서로 완성합니다. 앞 단계의 코드를 지우지 말고 같은 파일의 마지막 줄 아래에 다음 코드 조각을 이어서 작성합니다. 프로젝트 구조위치역할c:\openai_app_course\.venv모든 차시가 공유하는 Python 가상환경입니다.c:\openai_app_course\requirements.txtOpenA.. 2026. 9. 1. Whisper 음성 전사와 TTS 실시간 오디오 스트리밍 (1) 이 차시에서는 완성된 한국어 녹음 파일을 whisper-1로 전사(transcription)하고, 언어 정보와 전문용어 힌트가 결과에 미치는 영향을 비교합니다. 전사문과 구간별 타임스탬프를 저장한 뒤 Responses API로 사실 중심의 짧은 브리핑을 만들고, 마지막에는 gpt-4o-mini-tts가 생성하는 PCM 오디오를 전체 생성 완료 전부터 재생합니다.중요 안내: 현재 권장 전사 모델과 실습 범위OpenAI 공식 문서는 새로운 일반 목적의 녹음 파일 전사에 gpt-transcribe 사용을 권장합니다. 반면 whisper-1은 단어·구간 타임스탬프, SRT·VTT 자막, 녹음 파일의 영어 번역처럼 Whisper 전용 기능이 필요한 워크플로에 계속 사용할 수 있습니다. 이 교안은 차시 주제에 맞춰.. 2026. 9. 1. DALL·E 3 생성 구조와 GPT Image 2 마스크 편집 (3) 추가 실습 과제기본 실습을 완료한 뒤 별도 파일에서 기능을 확장합니다. 두 과제의 코드는 공통 설정과 검증 함수를 모두 포함하므로 기본 실습 파일을 가져오지 않고 각각 실행할 수 있습니다. 공통 가상환경과 과정 기본 디렉터리의 .env는 그대로 사용합니다. 챌린지 1. 주제 선택형 포스터 시안 3종 생성기lab05\poster_variations.py는 사용자가 입력한 축제 주제, 대상 학년, 핵심 색상을 바탕으로 구도가 다른 포스터 배경 시안 세 개를 생성합니다. 초안은 quality="low"로 만들고, 파일과 같은 내용을 설명하는 안전한 정보만 JSON 기록에 저장합니다.구현 요구사항축제 주제, 대상 학년, 핵심 색상을 입력받고 빈 값과 지나치게 긴 값을 거절합니다.같은 목적과 안전 제약을 유지하면.. 2026. 9. 1. 이전 1 2 3 4 ··· 81 다음 728x90 반응형