三條測試都先確認過會在舊版實作上失敗。第一版寫出來時有兩條其實是陪跑的—— 情境裡沒有後續段落,正確與錯誤的結果剛好都落在 body 結尾,分不出來。加上一個 真正的後續段落之後才有鑑別力。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
三條測試都先確認過會在舊版實作上失敗。第一版寫出來時有兩條其實是陪跑的—— 情境裡沒有後續段落,正確與錯誤的結果剛好都落在 body 結尾,分不出來。加上一個 真正的後續段落之後才有鑑別力。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>