Whisperã§æåèµ·ãããããæç« ãChatGPTã§ããæãã«ãã
Whisperã§æåèµ·ããããæç« ãããæãã«ããã
ã¿ã€ãã«éãã§ããWhisperã§æåèµ·ãããããŸããã
ãã ã以äžã®ããã«å¥èªç¹ããªãæç« ã«ãªã£ãŠããŸããèªã¿ã¥ããã§ãã
æšå£ äžçã®æŽå²ãã¥ã¬ãŒã·ã§ã³ããã°ã©ã ã³ãã³ã©ãžãªæšå£ äžçã®æŽå²ãã¥ã¬ãŒã·ã§ã³ããã°ã©ã ã³ãã³ã©ãžãªããŒãœããªãã£ãŒã®æ ªåŒäŒç€Ÿããã¯ä»£è¡šæšå£æž å ã§ãæ·±äº ãããŠæ ªåŒäŒç€Ÿã³ãã³ã®æ·±äº éä¹ä»ã§ãæšå£ ãããŠæ ªåŒäŒç€Ÿã³ãã³ã®æ¥ è±å²ã§ãæšå£ ãã®ã©ãžãªã¯æŽå²ãæãæŽå² ã®é¢çœããç¥ããããŠããŸã£ãæ·±äºããã代衚ãšããæ ªåŒäŒç€Ÿ ã³ãã³ã®ãäºäººãšäžç·ã«åŠæ ¡ã®ææ¥ã§ã¯ãªããªãåŠã¹ãªãåœå å€ ã®æŽå²ã®é¢çœããåŠããããããšããçªçµã§ããããããé¡ãããŸã
ãããä¿®æ£ããã®ã¯çµæ§ãããžãããã§ãããããæãã«ãã£ãŠãããŠæ¬²ããã§ãã
ChatGPTã§ããæãã«ãã
ãããªãšãã«é Œããªãã®ãChatGPTã§ãããããã³ããã¯ãããªæãã§ãã
æ¬¡ã®æç« ã®èª€èšèšæ£ãå¥èªç¹ã®è¿œå ãããŠãã ããã
極åå
ã®æç« ã¯å€æŽããªãããã«ããŠãã ããã
ããããä¿®æ£ãããæç« ãå
¥å
å®éã«ChatGPTã§è©ŠããŠã¿ãŸããããGPT4ã§ãã
å
¥åïŒã®äžéšïŒ

åºåïŒã®äžéšïŒ

ããæãã§ãããåãã§ãã
ããŒã¯ã³æ°ã®å¶é
ãã ããããã§ããŒã¯ã³æ°ã®åé¡ããããŸãã
GPT-3.5ã§4096ããŒã¯ã³

GPT-4ã§8192ããŒã¯ã³ã§ã

GPT-4-32kã¯32768ããŒã¯ã³ãã»ãããŸãããæ®å¿µãªãããŸã 䜿ããªãããã§ãã
ã¡ãªã¿ã«ããã®ããŒã¯ã³æ°ã¯å ¥åãåºåå«ããæ°ãªã®ã§ãä»åã®ããã«å ¥åãšåããããã®ããŒã¯ã³æ°ãåºåãããå Žåã¯ãGPT-3.5ã ãšçŽ2000ããŒã¯ã³çšåºŠããå ¥åã§ããªãããšã«ãªããŸããåºåã®ããŒã¯ã³æ°ã®å€åãèæ ®ãããš1000ããŒã¯ã³ãããã«æŒãããŠããã®ããã¿ãŒãããããŸããã
ç§ãæåèµ·ããããã³ãã³ã©ãžãªã®1ãšããœãŒãã®ããŒã¯ã³æ°ã¯ãGoogle Colabã§ä»¥äžã®ãããªã³ãŒããå®è¡ãããšç¢ºèªã§ããŸããã³ãŒãã¯openai/tiktokenãåèã«ããŸããã
!pip install -qq tiktoken
import tiktoken
from tqdm import tqdm
text = 'ããŒã¯ã³æ°ãæ°ãããããã¹ã'
model_name = 'gpt-4'
encoding = tiktoken.encoding_for_model(model_name)
count = len(encoding.encode(text))
print(count)
çµæã¯ãçŽ1äžïŒ9856ïŒãGPT4ã§ãå šéšã¯å ¥ããªãã§ããã
远èšïŒ2024/05/15 GPT-4oã«å¯Ÿå¿ããŠããŸãã
åå²ããã
å°é£ãªåé¡ã¯åå²ããããšããããšã§ãåå²ããã®ãè¯ãã§ããã
é©åœã«ãã©ãŠã¶ç»é¢ã§ãæäœæ¥ã§ã¡ãŸã¡ãŸåå²ããæç« ãã³ããããŠãããã®ã§ãããçµæ§é¢åã§ããé¢åãªããšã¯Pythonã«ããããŠããŸããŸãããã
ãšãã£ãŠããåçŽã«é©åœã«æåæ°ã ãã§åºåããšãåºåããå€ã«ãªãã®ã§ã圢æ çŽ è§£æããŠåå²ããŸãã
ChatGPTã«ãPythonã§æ¥æ¬èªã®åœ¢æ çŽ è§£æãããäžã§ãé·æã1000åèªã§åå²ããŠãã ããããšèããããããæãã®ã³ãŒããæžããŠãããã®ã§å©çšããŸãã
æ³šïŒ æ¬åœã¯ã圢æ çŽ åäœã§ãªãã1æåäœã§åºåãããšããããã§ãããæç« ä¿®æ£ã¯èŠçŽãªã©ã®ã¿ã¹ã¯ãšéããåºåããããã»ã©åé¡ã«ã¯ãªããªããšèããããã®ã§ä»åã¯ãµãããŸãã
!pip install -qq janome
from janome.tokenizer import Tokenizer
def split_text_into_chunks(text, max_tokens=1000):
tokenizer = Tokenizer()
tokens = list(tokenizer.tokenize(text, wakati=True)) # wakati=True returns a list of words
chunks = []
for i in range(0, len(tokens), max_tokens):
chunk = tokens[i:i+max_tokens]
chunks.append(''.join(chunk))
return chunks
chunks = split_text_into_chunks(transcription_text)
ããšã¯ããããé ã«ChatGPTã®APIã§åŠçããŠãããã°OKã§ãã
GPT3.5ãšGPT4ã§ã¯ãGPT4ã®æ¹ãä»äžãããåªç§ã§ãããGPT4ã ãšãã®åæéãšãéãããããšããæãã§ããã
Whisperã«ããã³ãã远å
ãããªã¢ããã€ã¹ãããã ããŸããã
調ã¹ããã確ãã«ãã£ãŠãã人ãããŸããã
ãªãã§ããšã ãä»ãŸã§ãã£ãŠããããšã¯ç¡é§ã ã£ãã®ããšçµ¶æããããŸãããã詊ãããšãããèªåã®ææã¡ã®ãªãŒãã£ãªãã¡ã€ã«ã§ã¯Whisperãžããã³ããå ¥åããŠããæåèµ·ããæç« ã«å¥èªç¹ã®è¿œå ã¯ã§ããŸããã§ãããã©ããé·æéã®ãã¡ã€ã«ã ãšãããŸã远å ã§ããªãããã§ãïŒè©³çŽ°ã¯æªæ€èšŒã§ãïŒã
å¬ãããããªæ®å¿µãªãããªçµæã§ããã
ãŸãšã
æåèµ·ããããæç« ãããæãã«ããã®ã«ãChatGPTã䟿å©ãšãã話ã§ããã
ãã®ãã¡ãWhisperãã¬ãã«ã¢ããããŠäžçºã§ãªãŒãã£ãªãã¡ã€ã«ããé«å質ã®ããã¹ããæåèµ·ããã§ããããã«ãªã£ãããChatGPTã®ããŒã¯ã³æ°å¶éã100äžããŒã¯ã³ã«ãªã£ããçšç¡ãã§ã¯ãããŸããããããŸã§åŸ ãŠãªãã®ã§èªåã®ããã«äœã£ãŠã¿ãŸããããããã£ãè€æ°ã®AIãçµã¿åãããŠäœãã¿ã¹ã¯ãå®çŸãããšãããã®ããä»åŸã¿ã±ãã³ã®ããã«ãã§ããã§ãåºãŠããããããªãããªãšæã£ãŠããŸãã
æåèµ·ããããããã®èšäºã§ç޹ä»ããæç« ã®ä¿®æ£ãŸã§ãå«ããŠãŸãšããGoogle Colabã®ããŒãããã¯ãGitHubã«ã¢ããããŸãããèªåã®ã¡ã¢çãªã³ãŒããªã®ã§ãããŸã説æã¯è©³ãããªãã§ããããªãšåã§äœ¿ã£ãŠããã ããã°âŠ
ChatGPTã®APIïŒæç« ã®ä¿®æ£ïŒã䜿ãå Žåã¯ãOpen AIã®ã·ãŒã¯ã¬ããããŒãå¿ èŠã§ããæåèµ·ããã ããªãäžèŠã§ãïŒããŒãããã¯ã®ååãæåèµ·ããéšåã§ãïŒã
åèãªã³ã¯
é¢é£èšäº
倿Žå±¥æŽ
- 2024/05/15 GPT-4oã«å¯Ÿå¿
- 2023/06/03 Whisperãžã®ããã³ããå ¥åã«é¢ããŠè¿œèš
Discussion