為 hash-id 新增 key 子命令並拆出獨立的名稱正規化模組,收斂雜湊組法為單一入口 #54

Merged
admin merged 1 commits from feat/hash-id-key-subcommand into develop 2026-09-08 02:45:25 +00:00
2 changed files with 66 additions and 1 deletions
+20 -1
View File
@@ -2,17 +2,36 @@
# hash-id — 產生完整 40 碼大寫 SHA-1 hash。 # hash-id — 產生完整 40 碼大寫 SHA-1 hash。
# 用法: # 用法:
# hash-id <text> # hash-id <text>
# hash-id key <計畫名稱> <owner/repo>
# printf '%s' <text> | hash-id # printf '%s' <text> | hash-id
# key 子命令的參數:
# 計畫名稱: 交給 normalize-name.sh 正規化後再接字串,同名不同打法算出同一把 key。
# owner/repo: 存取庫識別,原樣接上,不經正規化。
# 規則: # 規則:
# 取完整 SHA-1 四十碼,a-f 轉大寫,不截短、不加前綴。 # 取完整 SHA-1 四十碼,a-f 轉大寫,不截短、不加前綴。
# 輸入為空即 exit 2。空字串本身也有合法的 SHA-1,靜靜回傳它就會生出 # 輸入為空即 exit 2。空字串本身也有合法的 SHA-1,靜靜回傳它就會生出
# 一個看起來正常的頁名,把內容寫到沒有人讀的那一頁。 # 一個看起來正常的頁名,把內容寫到沒有人讀的那一頁。
# key 子命令把多個欄位接成雜湊輸入的組法收在這裡當單一入口:固定用 `|`
# 分隔,避免各技能各自接字串各接各的。正規化規則本身不是雜湊職責,收在
# 獨立那支工具,這裡只管接字串。
# 結束碼: 0=成功 1=這台機器沒有 sha1sum 也沒有 shasum,算不出雜湊 # 結束碼: 0=成功 1=這台機器沒有 sha1sum 也沒有 shasum,算不出雜湊
# 2=用法錯誤:沒有給文字,或給的是空字串 # 2=用法錯誤:沒有給文字,或給的是空字串
set -eu set -eu
dir=$(CDPATH= cd -- "$(dirname -- "$0")" && pwd)
input='' input=''
if [ "$#" -gt 0 ]; then if [ "${1:-}" = 'key' ]; then
shift
name="${1:-}"; repo="${2:-}"
if [ -z "$name" ] || [ -z "$repo" ]; then
echo 'usage: hash-id key <計畫名稱> <owner/repo>' >&2
exit 2
fi
# 正規化計畫名稱,讓「我的 計畫」與「我的 計畫」這類同名不同打法算出同一把 key。
name=$(sh "$dir/normalize-name.sh" "$name")
input="${name}|${repo}"
elif [ "$#" -gt 0 ]; then
input=$* input=$*
elif [ -t 0 ]; then elif [ -t 0 ]; then
input='' input=''
+46
View File
@@ -0,0 +1,46 @@
#!/usr/bin/env sh
# normalize-name — 正規化一個名稱字串,讓同一個名稱的不同打法算出同一個結果。
# 用法:
# normalize-name.sh <text>
# 規則(依序套用):
# 1. Unicode NFC 正規化
# 2. 去除頭尾空白
# 3. 內部連續空白(含全形空白)壓成一個半形空白
# 4. 英數全形字元轉半形(只轉英數,其他全形字元如標點不動)
# 大小寫不在正規化範圍內,維持原樣、視為不同名稱。
# 例子:
# normalize-name.sh "我的 計畫" -> 我的 計畫
# normalize-name.sh " Abc1 " -> Abc1
# 結束碼: 0=成功 1=這台機器沒有 python3,算不出正規化結果 2=用法錯誤:沒有給文字
set -eu
if [ "$#" -lt 1 ]; then
echo 'usage: normalize-name.sh <text>' >&2
exit 2
fi
if ! command -v python3 >/dev/null 2>&1; then
echo 'no python3 found' >&2
exit 1
fi
printf '%s' "$1" | python3 -c '
import sys, re, unicodedata
FULLWIDTH_OFFSET = 0xFEE0 # Unicode 全形英數區塊相對半形區塊的固定位移量
def to_halfwidth_alnum(ch):
if ("0" <= ch <= "9") or ("A" <= ch <= "Z") or ("a" <= ch <= "z"):
return chr(ord(ch) - FULLWIDTH_OFFSET)
return ch
name = unicodedata.normalize("NFC", sys.stdin.read())
name = name.strip()
name = re.sub(r"[ \t ]+", " ", name).strip()
# 只轉英數的全形字元,其他全形字元(例如全形標點)不動——只轉英數是規則本身
# 的範圍,不是整段跑 NFKC;NFKC 連標點都會改寫,會讓名稱的視覺呈現跟著變。
name = "".join(to_halfwidth_alnum(c) for c in name)
sys.stdout.write(name)
'