Merge pull request 'feat/ste100-scope-encoding-and-lint' (#20) from feat/ste100-scope-encoding-and-lint into develop
Reviewed-on: #20
This commit was merged in pull request #20.
This commit is contained in:
@@ -1,6 +1,6 @@
|
||||
{
|
||||
"name": "jsc-meta",
|
||||
"version": "0.1.1",
|
||||
"version": "0.1.2",
|
||||
"description": "技能組自我管理:新建、更新、刪除技能與技能準則",
|
||||
"skills": "./skills",
|
||||
"author": {
|
||||
|
||||
@@ -1,6 +1,6 @@
|
||||
{
|
||||
"name": "jsc-meta",
|
||||
"version": "0.1.1",
|
||||
"version": "0.1.2",
|
||||
"description": "技能組自我管理:新建、更新、刪除技能與技能準則",
|
||||
"skills": "./skills"
|
||||
}
|
||||
|
||||
+1
-1
@@ -1,6 +1,6 @@
|
||||
{
|
||||
"name": "jsc-meta",
|
||||
"version": "0.1.1",
|
||||
"version": "0.1.2",
|
||||
"description": "技能組自我管理:新建、更新、刪除技能與技能準則",
|
||||
"skills": "./skills/"
|
||||
}
|
||||
|
||||
@@ -40,7 +40,7 @@
|
||||
|
||||
## 語言
|
||||
|
||||
1. 所有交談與輸出內容使用 STE100 繁體中文,帶擬人台灣感:短句、一句一指令、主動語態、術語一致、台灣用語、全形標點、去 AI 味、直接講重點。完整規則的唯一來源:[`references/ste100.md`](ste100.md)。
|
||||
1. **所有非程式碼輸出**一律 STE100 繁體中文、UTF-8、無亂碼、無簡體字,帶擬人台灣感:短句、一句一指令、主動語態、術語一致、台灣用語、全形標點、去 AI 味、直接講重點。範圍涵蓋程式碼註解、commit 訊息、PR 描述、wiki 頁、對使用者的回報、README 與各種文件;程式碼本身(識別字、關鍵字、API 名稱)不受此規則限制。完整適用範圍表、編碼要求與替換表的唯一來源:[`references/ste100.md`](ste100.md)。
|
||||
2. **技能文件(SKILL.md)整份為英文**:frontmatter 與內文都是。風格比照 STE100:短句、祈使句、術語一致。
|
||||
3. 技能文件裡「要原樣輸出的繁中字面內容」保留繁中:wiki 狀態字串(例:已分析、未完成)、hook 注入文字、要寫進 wiki 或 commit 的文案。技能執行時產生的 commit 訊息、PR 描述、wiki 頁內容仍依第 1 條輸出繁中。
|
||||
4. README、AGENTS.md、`templates/`、`references/` 為 STE100 繁體中文。中文並列項用頓號「、」,不用半形「/」;英文項目的並列(CLI 名、頁名前綴)可用「/」。
|
||||
@@ -144,4 +144,5 @@
|
||||
- [ ] wiki repo 與 Gitea 認證先讀目前 shell 繼承的環境變數;只有缺值或無法解析時才詢問;頁面類型不得跨用其他 `JSC_WIKI_REPO_{TYPE}`
|
||||
- [ ] 問詢透過 jsc-ask 決策樹規則
|
||||
- [ ] SKILL.md 整份為英文(要原樣輸出的繁中字面除外);README、AGENTS、templates、references 為 STE100 繁中;UTF-8 無亂碼
|
||||
- [ ] 所有非程式碼輸出(程式碼註解、commit 訊息、PR 描述、wiki 頁、回報、文件)為繁體中文、UTF-8、無亂碼、無簡體字,且 `tools/ste100-lint.sh` 對該 domain 全綠
|
||||
- [ ] 已同步更新該 domain 的 README「Skills 目錄」與三份 manifest 的 version
|
||||
|
||||
+27
-2
@@ -4,11 +4,36 @@ jsc 技能組所有交談與文件的語言規則,唯一來源在這裡。基
|
||||
|
||||
上游版本:speak-human-tw v1.4.0(2026-07-18)。上游有新版時用 `jsc-meta:ste100-sync` 同步。
|
||||
|
||||
## 適用範圍
|
||||
|
||||
**所有非程式碼輸出一律適用**。程式碼本身不受限。
|
||||
|
||||
| 對象 | 適用 | 說明 |
|
||||
| :-- | :-- | :-- |
|
||||
| 程式碼註解 | 是 | 含檔頭說明與行內註解 |
|
||||
| commit 訊息 | 是 | 標題與內文;type 與 scope 仍為英文 |
|
||||
| PR 描述 | 是 | 標題、各節內文 |
|
||||
| wiki 頁內容 | 是 | 頁名前綴與範本欄位名維持英文 |
|
||||
| 對使用者的回報 | 是 | 交談、進度回報、錯誤說明 |
|
||||
| README、AGENTS.md | 是 | |
|
||||
| `references/`、`templates/` | 是 | |
|
||||
| 程式碼識別字、關鍵字、API 名稱 | 否 | 變數、函式、型別、參數、指令、路徑、URL |
|
||||
| SKILL.md | 否 | 整份英文,規則見 `guidelines.md`「語言」 |
|
||||
|
||||
## 基礎紀律
|
||||
|
||||
1. 短句,一句一指令,主動語態。
|
||||
2. 同一個概念全程用同一個詞,不換詞循環。
|
||||
3. UTF-8,無亂碼。
|
||||
|
||||
## 編碼
|
||||
|
||||
| 要求 | 內容 | 常見違規 |
|
||||
| :-- | :-- | :-- |
|
||||
| UTF-8 | 檔案一律 UTF-8(無 BOM) | Big5、GBK 存檔 |
|
||||
| 無亂碼 | 不得出現替代字元或雙重編碼殘留 | `�`、`�`、`ä`、`â` 開頭的三字元序列 |
|
||||
| 無簡體字 | 一律繁體字形 | 应、这、说、国、网、码 |
|
||||
|
||||
亂碼多半來自轉檔或複製貼上,肉眼容易漏掉,交給 `tools/ste100-lint.sh` 的「亂碼」類別擋。
|
||||
|
||||
## 台灣用語
|
||||
|
||||
@@ -63,4 +88,4 @@ jsc 技能組所有交談與文件的語言規則,唯一來源在這裡。基
|
||||
|
||||
## 機檢
|
||||
|
||||
可機檢的部分(中國用語、中文句內半形標點、AI 套話)用 `tools/ste100-lint.sh <file|dir>` 檢查,命中 exit 1。掃描時跳過本檔(規則文件裡的詞是被討論,不是被使用);語感與翻譯腔仍要人工判讀。
|
||||
可機檢的部分(中國用語、中文句內半形標點、AI 套話、簡體字、亂碼、並列斜線)用 `tools/ste100-lint.sh <file|dir>` 檢查,命中 exit 1。`.md` 與 `.json` 跑全部類別;程式碼檔只跑簡體字與亂碼,其餘類別對英文標點與路徑誤報率太高。掃描時跳過本檔(規則文件裡的詞是被討論,不是被使用);語感與翻譯腔仍要人工判讀。
|
||||
|
||||
+89
-13
@@ -7,16 +7,66 @@
|
||||
# 3. 常見 AI 套話(總的來說、綜上所述、希望這對你有幫助 等)
|
||||
# 4. 簡體字(只收沒有繁體正當用法的字,避免誤報)
|
||||
# 5. 中文並列項用斜線(半形 / 或全形 / 夾在中日韓字元之間),應改頓號「、」
|
||||
# 6. 亂碼(U+FFFD 替代字元、Latin-1 雙重編碼殘留)
|
||||
# 輸出: {檔案}:{行號}:{類別}:{命中內容};全部通過 exit 0,有命中 exit 1。
|
||||
# 限制: 掃 .md 與 .json 檔;程式碼圍欄內的內容可能誤報,人工複核。
|
||||
# references/ste100.md 本身跳過——規則文件裡的詞是被討論,不是被使用。
|
||||
# 掃描範圍與分流:
|
||||
# 文件檔(.md、.json)跑全部六項。
|
||||
# 程式碼檔(.sh .js .ts .py .cs .java .go .rb .php .sql .yml .yaml .toml)只跑簡體字與亂碼。
|
||||
# 理由: 程式碼註解也要繁中無亂碼,但中國用語、半形標點、AI 套話、並列斜線這四項在程式碼裡
|
||||
# 誤報率太高——英文標點、檔案路徑、URL、正規表示式到處都是半形逗號與斜線,識別字也常撞到
|
||||
# 替換表左欄。只留簡體字與亂碼,命中就幾乎都是真的。
|
||||
# 限制: 程式碼圍欄內的內容可能誤報,人工複核。
|
||||
# references/ste100.md 與本檔本身跳過——規則文件與規則實作裡的詞是被討論,不是被使用。
|
||||
# 並列斜線會誤報兩類:含中文的路徑或分支名範例(例 feat/報表/P2),
|
||||
# 以及英文項目並列(準則允許)。命中後先判斷是不是真的並列項。
|
||||
set -u
|
||||
TERMS='默認|支持某|兼容|信息|數據庫|服務器|軟件|硬件|網絡|質量|卸載|反饋|視頻|屏幕|鼠標|打印|立馬|靠譜|賦能|閉環|抓手|復盤'
|
||||
CLICHES='總的來說|綜上所述|希望這對你有幫助|好問題|在當今|瞬息萬變|標誌著|奠定了基礎|體現了|不僅僅是|讓我們一起'
|
||||
# 亂碼特徵,全部用十六進位跳脫寫,本檔才不會存進真的亂碼字元自己打自己:
|
||||
# \x{fffd} 替代字元,轉檔失敗留下的痕跡
|
||||
# \x{ef}\x{bf}\x{bd} U+FFFD 本身又被雙重編碼一次(顯示成 �)
|
||||
# [\x{c2}-\x{f4}][\x{80}-\x{bf}]
|
||||
# 雙重編碼特徵:UTF-8 位元組被當 Latin-1 解讀再存回去,原本的前導位元組變成
|
||||
# U+00C2–U+00F4 的拉丁字母(Ã、â、ä),後面緊跟著本來的續接位元組 U+0080–U+00BF。
|
||||
# 兩者相連在正常文字裡幾乎不會出現,所以誤報極低;只寫 Ã 或 â 開頭會漏掉中日韓
|
||||
# 字元最常見的 ä¸ 這一類。
|
||||
GARBLED='\x{fffd}|\x{ef}\x{bf}\x{bd}|[\x{c2}-\x{f4}][\x{80}-\x{bf}]'
|
||||
# 簡體字表的真實來源是 jsc-hooks 的 hooks/simplified.txt(ste100-guard.sh 共用同一份)。
|
||||
# 讀不到就退回下面的內建備援字表。備援不能拿掉: jsc-hooks 不一定裝在這台機器上(單獨 clone
|
||||
# plugins/meta、CI 只取一個 repo 都會發生),缺了基礎設施就讓簡體字檢查靜靜失效,會把「沒命中」
|
||||
# 變成假通過,比不檢查更危險。
|
||||
# 刻意排除繁體也在用的字(后、台、干、只、里、面、制、志),只留簡化後才出現的字形。
|
||||
SIMPLIFIED='应|为|这|说|发|国|过|对|开|关|问|题|东|车|马|鸟|龙|飞|见|无|产|业|务|书|写|学|习|报|纸|认|识|证|际|网|络|计|划|实|现|给|条|约|级|组|织|变|换|电|脑|两|双|单|构|价|钱|众|议|论|传|统|么|儿|们|从|来|时|间|长|门|闻|声|员|图|团|转|输|达|运|进|远|连|边|还|经|该|营|规|则|范|围|参|数|类|结|态|设|备|辑|译|码|库|档'
|
||||
SIMPLIFIED_FALLBACK='应|为|这|说|发|国|过|对|开|关|问|题|东|车|马|鸟|龙|飞|见|无|产|业|务|书|写|学|习|报|纸|认|识|证|际|网|络|计|划|实|现|给|条|约|级|组|织|变|换|电|脑|两|双|单|构|价|钱|众|议|论|传|统|么|儿|们|从|来|时|间|长|门|闻|声|员|图|团|转|输|达|运|进|远|连|边|还|经|该|营|规|则|范|围|参|数|类|结|态|设|备|辑|译|码|库|档'
|
||||
|
||||
# 找共用字表。搜尋路徑比照 jsc-hooks/hooks/lib.sh 的 jsc_gitea_sh():
|
||||
# 先環境變數,再開發用的並排存取庫版面,最後已安裝的 plugin 快取版面。
|
||||
simplified_file() {
|
||||
if [ -n "${JSC_SIMPLIFIED_FILE:-}" ] && [ -f "$JSC_SIMPLIFIED_FILE" ]; then
|
||||
printf '%s\n' "$JSC_SIMPLIFIED_FILE"; return 0
|
||||
fi
|
||||
_root="${CLAUDE_PLUGIN_ROOT:-$(dirname "$0")/..}"
|
||||
# 開發用的並排存取庫版面:{workspace}/meta 旁邊就是 {workspace}/hooks
|
||||
for _c in "$_root/../hooks/hooks/simplified.txt" "$_root/../jsc-hooks/hooks/simplified.txt"; do
|
||||
[ -f "$_c" ] && { printf '%s\n' "$_c"; return 0; }
|
||||
done
|
||||
# 已安裝版面:每個 plugin 各有版本目錄,取排序最後的一份(通常即最新版)
|
||||
_c=$(ls "$_root"/../../jsc-hooks/*/hooks/simplified.txt \
|
||||
"$_root"/../../hooks/*/hooks/simplified.txt \
|
||||
"$HOME"/.claude/plugins/cache/*/jsc-hooks/*/hooks/simplified.txt 2>/dev/null \
|
||||
| sort | tail -n1)
|
||||
[ -n "$_c" ] && [ -f "$_c" ] && { printf '%s\n' "$_c"; return 0; }
|
||||
return 1
|
||||
}
|
||||
|
||||
SIMPLIFIED=''
|
||||
SIMPLIFIED_SRC=$(simplified_file || true)
|
||||
if [ -n "$SIMPLIFIED_SRC" ]; then
|
||||
# 一行一個字,# 開頭與空行忽略,行內空白去掉,再串成 grep -E 的交替式
|
||||
SIMPLIFIED=$(sed 's/#.*//; s/[[:space:]]//g' "$SIMPLIFIED_SRC" \
|
||||
| grep -v '^$' | tr '\n' '|' | sed 's/|$//')
|
||||
fi
|
||||
[ -n "$SIMPLIFIED" ] || SIMPLIFIED=$SIMPLIFIED_FALLBACK
|
||||
|
||||
hit=0
|
||||
# 不帶參數會空跑並回 0,看起來像「全部通過」。這種假通過比不檢查更危險,所以擋掉。
|
||||
if [ "$#" -eq 0 ]; then
|
||||
@@ -24,16 +74,36 @@ if [ "$#" -eq 0 ]; then
|
||||
echo '沒有給檢查對象。空跑會回 0,看起來像通過,所以這裡直接視為錯誤。' >&2
|
||||
exit 2
|
||||
fi
|
||||
skip() { # $1=路徑;規則文件、字表與規則實作本身不掃
|
||||
# 這幾個檔案裡的簡體字是被討論、被列舉的對象,不是被使用。掃它們等於自己打自己,
|
||||
# 每次都命中卻永遠改不掉,久了就會有人把整個檢查關掉。
|
||||
case "$1" in
|
||||
*/references/ste100.md|references/ste100.md) return 0 ;;
|
||||
*/tools/ste100-lint.sh|tools/ste100-lint.sh) return 0 ;;
|
||||
*/hooks/simplified.txt|simplified.txt) return 0 ;;
|
||||
*/hooks/ste100-guard.sh|ste100-guard.sh) return 0 ;;
|
||||
*/hooks/lang-guard.sh|lang-guard.sh) return 0 ;;
|
||||
*) return 1 ;;
|
||||
esac
|
||||
}
|
||||
kind() { # $1=路徑;輸出 doc(跑全部六項)或 code(只跑簡體字與亂碼),其餘不掃
|
||||
case "$1" in
|
||||
*.md|*.json) printf 'doc' ;;
|
||||
*.sh|*.js|*.ts|*.py|*.cs|*.java|*.go|*.rb|*.php|*.sql|*.yml|*.yaml|*.toml) printf 'code' ;;
|
||||
*) printf '' ;;
|
||||
esac
|
||||
}
|
||||
files() {
|
||||
for p in "$@"; do
|
||||
if [ -d "$p" ]; then
|
||||
find "$p" \( -name '*.md' -o -name '*.json' \) \
|
||||
-not -path '*/.git/*' -not -path '*/references/ste100.md'
|
||||
find "$p" \( \
|
||||
-name '*.md' -o -name '*.json' \
|
||||
-o -name '*.sh' -o -name '*.js' -o -name '*.ts' -o -name '*.py' \
|
||||
-o -name '*.cs' -o -name '*.java' -o -name '*.go' -o -name '*.rb' \
|
||||
-o -name '*.php' -o -name '*.sql' -o -name '*.yml' -o -name '*.yaml' \
|
||||
-o -name '*.toml' \) -not -path '*/.git/*'
|
||||
else
|
||||
case "$p" in
|
||||
*/references/ste100.md|references/ste100.md) ;;
|
||||
*) echo "$p" ;;
|
||||
esac
|
||||
echo "$p"
|
||||
fi
|
||||
done
|
||||
}
|
||||
@@ -42,10 +112,16 @@ check() { # $1=檔案 $2=類別 $3=grep 模式 $4=grep 旗標
|
||||
if [ -n "$out" ]; then printf '%s\n' "$out"; hit=1; fi
|
||||
}
|
||||
for f in $(files "$@"); do
|
||||
check "$f" "中國用語" "$TERMS" E
|
||||
check "$f" "半形標點" '[\x{4e00}-\x{9fff}][,;!?]|[,;][\x{4e00}-\x{9fff}]' P
|
||||
check "$f" "AI 套話" "$CLICHES" E
|
||||
skip "$f" && continue
|
||||
k=$(kind "$f")
|
||||
[ -n "$k" ] || continue
|
||||
if [ "$k" = doc ]; then
|
||||
check "$f" "中國用語" "$TERMS" E
|
||||
check "$f" "半形標點" '[\x{4e00}-\x{9fff}][,;!?]|[,;][\x{4e00}-\x{9fff}]' P
|
||||
check "$f" "AI 套話" "$CLICHES" E
|
||||
check "$f" "並列斜線" '[\x{4e00}-\x{9fff}][ ]?[//][ ]?[\x{4e00}-\x{9fff}]' P
|
||||
fi
|
||||
check "$f" "簡體字" "$SIMPLIFIED" E
|
||||
check "$f" "並列斜線" '[\x{4e00}-\x{9fff}][ ]?[//][ ]?[\x{4e00}-\x{9fff}]' P
|
||||
check "$f" "亂碼" "$GARBLED" P
|
||||
done
|
||||
exit $hit
|
||||
|
||||
@@ -18,7 +18,7 @@
|
||||
# 結束碼: 0=正本讀到、每個 domain 都在本機,而且每個既有存取庫都更新到最新
|
||||
# 1=讀不到正本 marketplace 或找不到 gitea.sh(不輸出任何 domain)
|
||||
# 2=正本讀到,但有 domain 沒能取得或 clone 失敗(已輸出其餘 domain)
|
||||
# 3=每個 domain 都在本機,但有存取庫沒更新到最新:工作區脏而跳過 pull,
|
||||
# 3=每個 domain 都在本機,但有存取庫沒更新到最新:工作區髒而跳過 pull,
|
||||
# 或 pull 失敗。stderr 會逐一列出這些路徑。**exit 0 才代表「全部最新」**;
|
||||
# 拿 3 當乾淨會讓後續步驟改在落後的檔案上。
|
||||
# 同時發生時回較嚴重的那個:2 蓋過 3。
|
||||
|
||||
Reference in New Issue
Block a user