深色網格背景上的 TypeSafe AI 標誌

Jev 是什麼?TypeSafe 決策模型、新手教學、費用與中文操作範例

Jev 是 TypeSafe AI 開發的 AI 決策模型,主要替軟體做分類、評分與是非判斷,例如讀完一封詢問信,判斷它是影片製作詢價、企業內訓邀約,還是需要人工查看的其他訊息,再把結果交給後續程式處理。

第一次接觸,我建議新手從「替詢問信分類」開始,你能清楚定義選項,也容易檢查答案,下面會提供可以複製的繁體中文範例,帶你看懂 Jev 的用途、費用,以及如何在網頁介面完成第一個練習。

Jev 已開放所有人註冊。 TypeSafe 官網在 2026 年 9 月 20 日宣布取消候補名單,現在可以直接建立帳號,不必再等白名單邀請。開放註冊與使用費用是兩件事,計費方式會在後面說明。

快速找答案

Jev 和 ChatGPT 差在哪?

Jev 的主要用途,是把讀懂文字後的判斷,交回程式使用,TypeSafe 將這類模型稱為 System One Model,你提供資料與問題,它回傳固定選項或數值。

假設你經營一間工作室,每天收到不同詢問,有人要拍影片,有人想邀請講師,也有人只寫「想合作」,你需要先決定誰接手,再開始回覆與安排,Jev 適合放在這個分流步驟。

你要完成的工作我的建議原因
替新企劃發想、寫介紹文或草擬回信使用擅長文字生成的 AI你需要一段完整內容
從固定類別中判斷詢問應交給誰可以測試 Jev你需要的是分類結果
表單已經勾選「企業內訓」直接用表單規則分流資料已有明確答案,不必再請模型猜
決定接不接案、承諾價格與交期由負責人確認這牽涉產能、商業條件與承諾

一般大語言模型也能

Jev 可以做哪三種判斷?分類、評分、是非判斷

先記中文用途就好:TypeSafe 的三種題型分別是「分類(Choice)」「評分(Score)」與「是非判斷(Noul)」。

你選題型時,只要先問自己:我需要一個類別、一個程度,還是一個是非答案?

假設收到一封食品品牌的信,對方想做 30 秒新品影片,請你提供報價,並希望本週五前回覆,同一封信可以提出三個不同問題:

你想知道什麼選哪種題型結果拿來做什麼
這是製作詢價、課程邀約、內容合作,還是其他需求?分類(Choice)分派給合適的服務窗口
對方催促回覆的程度有多強?評分(Score)在同類詢問中,安排人工查看的順序
對方有沒有明確要求報價?是非判斷(Noul)提醒承辦人準備費用資訊

三題都讀同一封信,但各自回答自己的問題。

分類(Choice):從你列好的選項中選一個

你先列出「製作詢價、課程邀約、內容合作、其他」,並說明各自範圍,Jev 再判斷這封信最接近哪一類。

分類結果會包含選中的類別與各選項的機率,例如選到「製作詢價」,後續流程就可以替信件加上這個標籤。

客戶委託製作「員工教學影片」,要交付的是影片,應歸製作服務,邀請你到公司「教員工拍影片」,要交付的是課程,才歸課程邀約。不能只看到「教學」或「影片」就決定類別。

我也會保留「其他」,承接資訊不足或沒有明確主次的多重需求,讓流程有地方把案件交回人工查看。

評分(Score):依你定義的等級,判斷程度

要安排回覆順序,可以問「對方催促回覆的程度有多強?」先把判斷標準寫清楚:

等級位置具體判斷標準
0沒有提出回覆期限,也沒有催促回覆
1提出回覆期限或希望儘快回覆,但沒有要求立即處理
2明確要求立刻、馬上或立即回覆

這封信寫「希望本週五前收到初步回覆」,按照我們設定的規則,人工預期會接近第 1 級。

Score 的等級從 0 起算,三個等級就是 0、1、2。分數依各等級的機率加權計算,因此可以有小數:假設第 1 級占 60%、第 2 級占 40%,分數會是 1 × 0.6 + 2 × 0.4 = 1.4。

1.4 是這組等級上的分數位置。 這組分數範圍是 0~2,數值越高代表我們定義的催促程度越強,並不表示模型答對的機率。

是非判斷(Noul):判斷一個條件是否成立

如果只想知道「這封信是否明確要求報價」,就用 Noul。它回傳 0~1 之間、代表回答「是」的機率:

示意數值可以怎麼讀
0.98模型非常傾向回答「有要求報價」
0.50「是」與「否」的機率接近,需要查看原文與問題定義
0.02模型非常傾向回答「沒有要求報價」

0.98 不是整個系統有 98% 正確率,0.50 也不是客戶「有一半想報價」。Noul 回答的是你提出的這一道是非題,沒有另外一個 confidence 欄位。

記得分清楚:問「有沒有要求立即回覆」是是非判斷,問「催得多急」才需要評分。如果只要前者,用一題 Noul 就夠了。

Jev 怎麼用?從註冊到第一個繁體中文練習

Playground 是可以在瀏覽器直接操作的測試介面,第一次練習不用先寫程式。

以下依官方快速開始文件設計,使用虛構詢問信與人工預期答案,方便你照著練習與核對。

建立帳號,進入 Playground

到 TypeSafe 官網選擇「Create your account」,或直接開啟 Playground 入口。(官方已取消候補名單,不必申請白名單)

入口頁提供 Google 與電子郵件選項,依畫面完成註冊或登入後進入 Playground。若帳號提示需要設定計費或購買額度,先查看費用與用量條件,開放註冊不代表所有模型請求都免費。

TypeSafe 登入頁提供 Google 與 Email 兩種登入方式。

貼上待判斷的資料(State)

State 就是「這次要給模型讀的內容」,先放一封信即可,可以複製以下內容:

我們是台灣的食品品牌,想委託製作一支 30 秒新品介紹影片,
預計下個月在社群投放,現在已有產品照片。
請提供製作流程與報價,希望本週五前收到初步回覆。

這次會練習三件事:分派服務類別、判斷回覆催促程度,以及確認對方有沒有要求報價。先把問題限定在信裡已寫出的內容。

接下來會遇到三個欄位名稱:資料(State)放信件,問題指令(Instructions)放你要問的事,判斷標準(Criteria)放分類選項或評分等級。是非題則直接用指令描述要判斷的條件。

新增分類題(Choice),設定選項

新增 Choice 題型,把下列文字放進問題指令(Instructions):

根據來信要求我們完成的工作,選擇一個最合適的分類。
不要只靠單一關鍵字判斷,要看對方想要的交付內容。
若同時提出兩種不同服務,且沒有明確主次,選「其他」。
若資訊不足以辨認需求,也選「其他」。

再將以下選項及說明,分別填入分類標準(Criteria):

選項分類標準
製作詢價委託影片、動畫或設計製作,詢問流程、時程或價格,包含委託製作教學影片
課程邀約邀請講師授課、演講、帶工作坊,或替組織安排教育訓練
內容合作提議聯名、贊助、內容交換或共同推廣,主要工作不是委託製作或邀請授課
其他不符合以上類別、資訊不足,或同時要求不同服務且沒有明確主次

以這封信來說,我們人工預期的分類是「製作詢價」,理由是對方要委託一支新品影片,並要求流程與報價。

如果介面需要替問題命名,可以取名為 request_type,但真正的判斷規則仍要填進指令與分類標準,Choice 文件說明,問題 ID 只是辨認答案的名稱,不會送給模型當作指令。

新增評分題(Score),設定催促程度

新增 Score 題型,問題指令可以直接複製:

這封信對回覆的催促程度有多強?
只根據信中對回覆時間的要求判斷,不推測寄件人的情緒。
不要把影片交件時間當成要求我們回信的時間。

將下面三行依序填成三個評分標準,由低到高排列:

沒有提出回覆期限,也沒有催促回覆。
提出回覆期限或希望儘快回覆,但沒有要求立即處理。
明確要求立刻、馬上或立即回覆。

介面若需要問題名稱,可以填 reply_urgency。等級位置由排列順序決定,規則要寫成上面的完整描述,只填「低、中、高」會讓模型缺少具體依據。

新增是非題(Noul),判斷是否要求報價

新增 Noul 題型,指令可以寫:

來信是否明確要求我們提供報價、費用或價格資訊?
只根據這封信已寫出的需求判斷。

介面若需要問題名稱,可以填 needs_quote。這題確認回覆時要準備哪些資訊,與服務分類、催促程度各自回答不同問題。

執行後,逐題核對結果

完成問題設定後執行,先依下面三項核對,不要要求模型一定回傳某個特定小數。

要檢查的結果這封信的人工預期回頭核對哪句話
分類(Choice)製作詢價想委託製作一支 30 秒新品介紹影片
評分(Score)接近第 1 級希望本週五前收到初步回覆,未要求立即處理
是非判斷(Noul)傾向回答「是」請提供製作流程與報價

上表是人工預期,不是模型執行紀錄。若實際結果不同,先保存原文、問題設定與回傳答案,再檢查分類邊界或評分標準。

用六筆資料,檢查規則是否寫清楚

把以下每列訊息輪流換進 State,沿用同一組問題與分類標準,第三欄是人工預期的「是否要求報價」,不是模型回傳的機率值。

練習訊息人工預期分類人工預期是否要求報價
想委託拍一支新品影片,請提供製作報價製作詢價是
想邀請講師替公司上兩小時 AI 課程,請問費用?課程邀約是
我們有一份工具電子報,想交換文章推薦,請問有興趣嗎?內容合作否
想談合作,方便聯絡嗎?其他否
想請你製作三支員工教學影片,內容由我們提供,請估價製作詢價是
想委託品牌影片,也想安排一場內訓,兩項都請提供報價其他是

第五筆用來檢查模型會不會被「教學」兩字帶走,第六筆則檢查它能否遵守多重需求的分流規則,把沒有主次的來信交給人工處理。

你可以增加一欄記錄 Jev 實際回覆,若改過分類標準,就把六題重新跑一遍,確認修好一題時沒有弄錯另一題,這組練習用來理解操作,正式評估時還要另留一批沒有拿來改規則的真實樣本。

Jev 費用怎麼算?先分清楚單價與用量

TypeSafe 的模型與價格文件列出,Jev 1.13 的輸入價格為每 100 萬 tokens 0.042 美元,輸出 tokens 免費。

假設每次請求的資料、問題與分類標準合計為 1,500 個輸入 tokens,每筆只呼叫一次,可以這樣估算:

處理筆數假設總輸入用量模型輸入費用
100 筆150,000 tokensUS$0.0063
1,000 筆1,500,000 tokensUS$0.063
10,000 筆15,000,000 tokensUS$0.63

算式是「總輸入 tokens ÷ 1,000,000 × 0.042」,上表是用量假設,不是前面六題的測試帳單,實際費用要計入你送出的資料與問題,重試會增加用量,串接平台、其他模型與人工處理費用則另外計算。

想進一步理解官方的速度比較與創辦人背景,可以接著閱讀 Jev 的速度與費用分析,把入門操作與效能評估分開看,會更容易判斷自己需不需要導入。

Jev 支援中文嗎?分錯時先檢查這些地方

Jev 能處理中文文字,但官方語言說明指出,英文是主要訓練語言,目前效果最好,繁體中文的口語、產業用語與混合需求,要用自己的樣本檢查,不能直接套用英文案例的表現。

假設你把分類設成「企業/課程/其他」,一封「企業想安排課程」的信,同時符合前兩項,這時應先修分類方式,讓每個選項對應不同服務,再重新測試。

遇到的狀況可以怎麼改
製作教學影片,被分成講師邀約明寫「看對方要的交付內容」,並在製作類別補上教學影片
一封信同時談影片與內訓在指令定義主次規則,無主次就先選「其他」
只有「想合作」也被分成某項服務加入資訊不足的出口,避免替對方補出未說明的需求
選了正確類別,後續卻沒有動作檢查工作流程是否接上,分類答案本身不會移動信件

如果資料來自照片、錄音或影片,要先用其他工具轉成文字,Jev 1.13 接受文字輸入,不能直接閱讀影片畫面,轉錄漏掉的條件也會影響分類。

什麼工作值得用 Jev?

我的判斷是:當同一種文字判斷會大量重複,答案能事先定義,而且你有資料可以核對結果時,Jev 才有清楚的測試價值。

例如品牌收到大量自由填寫的詢問、課程平台要分派學員問題,或團隊每天要替新文件歸類,都可以先挑一個步驟測試,如果表單本來就有完整分類,直接用現有欄位處理通常更省事。

從前面的練習走到自動化,可以分成以下幾步:

  1. 表單或信箱把新訊息交給流程。
  2. 流程把文字與問題送給 Jev。
  3. Jev 回傳服務類別與是否要求報價的判斷。
  4. 流程依結果寫入待辦表,無法明確分類的訊息交給人查看。
  5. 回覆文字由人員或文字生成模型草擬,價格與交期由負責人確認。

這和企業導入 AI 影音工作流程的思考相通:先找到卡住的一段,定義好輸入與完成標準,再決定用哪個工具,Jev 在這裡負責的是文字判斷這一段。

總結:先用小題目測,不要一開始就自動化

Jev 適合處理「答案可以先定義」的重複文字判斷。新手可以先用一封詢問信練習分類、評分與是非判斷,再用六筆資料檢查規則是否清楚。

真正要導入工作流程前,先確認三件事:輸入資料是否穩定、錯誤答案由誰檢查,以及分類結果接到哪個後續動作。這三件事沒想清楚,只追求模型費用很低,通常不會讓流程變好。

Jev 分類任務程式碼與輸出結果的終端機示範

推薦閱讀


參考資料

常見問題 FAQ

不會寫程式,可以使用 Jev 嗎?

可以先從官方 Playground 開始,現在已開放所有人註冊,登入後可依介面設定問題,在瀏覽器練習分類與判斷。要讓信件自動進來、把結果寫入其他工具,則需要後續 API 或工作流程串接。

Jev 還需要申請白名單嗎?

不需要。TypeSafe 官網已在 2026 年 9 月 20 日宣布取消候補名單,開放建立帳號。註冊後仍需依帳號的計費與可用額度使用服務。

Jev 是免費的嗎?

Jev 採用量計費,Jev 1.13 的官方價格是每百萬輸入 tokens 0.042 美元,輸出 tokens 不收費,帳號是否提供試用額度需查看方案資訊,不能把輸出免費理解成整次請求免費。

Jev 可以取代 ChatGPT 幫我寫文章嗎?

Jev 用於分類、評分與條件判斷,不提供一般文章生成,你可以讓它判斷文章類別或是否符合指定條件,完整寫作交給文字生成模型處理。

為什麼 Jev 的 confidence 很高,分類還是錯了?

高 confidence 代表模型的答案集中在某個選項,仍要核對分類是否符合事實,先檢查選項是否重疊、資料是否缺漏,再用保留的測試樣本驗證修改結果。

Similar Posts