9月28日から10月4日朝までに最も多くのいいねとブックマークを集めたのは、AIが書いた日本語を推敲するスキル「yomiyasu」の記事でした。ほかに、テストと設計、脆弱性の診断、ある開発チームのLLMの使い分け、利用枠の減り方を扱った記事を選んでいます。

この記事でわかること

  • 推敲スキル3つのうち、構成を残して表現だけを直すのは「yomiyasu」で、ほかの2つは段落や文体まで変えます
  • シーケンス図を仕様として、実際の呼び出し順をテストで自動照合する方法をソフトバンクの開発者が示しました
  • Max 20xプランでの実測では、ヘッドレス実行は対話よりも速く5時間枠を減らし、ピーク外で2倍でした
この記事の目次(6節)
  1. 推敲スキル「yomiyasu」を、ほかの2つと比べると
  2. AIに書かせるテストと、人が担う設計
  3. 設計はテストで確かめられる仕様として書く
  4. AIで脆弱性を探す「Codex Security」と「Claude Security」
  5. ある開発チームのLLMの使い分け、クラウドと手元のマシン2台
  6. Claude CodeとCodexの利用枠は、何で減っているのか

推敲スキル「yomiyasu」を、ほかの2つと比べると

「yomiyasu」は、AIが書いた不自然な日本語を、文の組み立てから直すスキルです。禁止語の一覧で言葉を縛るのではなく、物事を主語にした文を人が動作する文に直し、名詞を連ねた句を動詞を使った文に戻します。Claude Codeなどのコーディング用のAIエージェントで使え、MITライセンスで公開されています。1 当サイトでは10月1日の記事「AIっぽい日本語を直すスキル『yomiyasu』公開」で、付属の検査スクリプトを試しました。

inoyu-qiita氏は、同じモデル・同じ原文・同じ指示で、「yomiyasu」と「natural-japanese」「japanese-tech-writing」を比べました。「yomiyasu」は構成を残し、強すぎる表現だけを直しました。「natural-japanese」は見出しや段落を組み直し、「japanese-tech-writing」は文体を常体に変えました。どれが優れているかではなく、どこまで直してほしいかで選ぶ、というのが同氏の結論です。2 AIの下書きを社内の文書に使っているなら、どこまで直させるかを決めてから選ぶとよいでしょう。

AIに書かせるテストと、人が担う設計

ABAB↑↓BA氏は、AIにコードを書かせるようになってもテストの種類ごとの役割は変わらないと説きます。型チェック・Lint・単体テストは、ロジックの誤りを速く見つけます。統合テストとE2Eテストは、外部システムとの連携や画面の操作を確かめます。想定外の使い方で起きる不具合は自動テストでは拾えないため、人が操作して確かめる探索的テストで探します。3

同氏は、人が担うべきは「誤ったコードを書けなくする設計」だと述べています。関数の引数を数値や文字列のままにしておくと、AIは思いついた入力だけでテストを書きます。型で取りうる値を絞っておけば、AIが書いたテストの抜けも減るという考え方です。3 テストが本当に不具合を検出できるかの確かめ方は、当サイトの記事「わざと壊して失敗を見届ける」で紹介しました。

設計はテストで確かめられる仕様として書く

テストの記事と同じ9月29日に、設計の立場から同じ問題を扱った記事も出ました。記事の出発点は、細かい仕様を渡さずにAIにコードを書かせると、あいまいなところをAIが推測で埋めてしまうという問題です。4

田邉氏は、処理の呼び出し順をシーケンス図で書くよう提案しています。テスト実行時に呼び出し順を記録し、図と一致するかを自動で照合する仕組みです。注文処理のサンプルコードで、この照合のやり方を示しました。人はコードの細部ではなく、仕様が妥当かどうかを見ればよくなる、という考え方です。4 AIに実装を任せる範囲を広げたい開発責任者向けの記事です。

AIで脆弱性を探す「Codex Security」と「Claude Security」

npaka氏は、OpenAIのCodex Securityと、AnthropicのClaude Securityを並べて紹介しました。どちらも、コード全体の流れを読んで脆弱性を探し、修正案まで示します。5

従来の静的解析ツールは、SQLインジェクションのような既知のパターンを探します。これに対し両ツールは、ログイン、API、権限チェック、データベースとたどる処理の流れを追います。アプリ固有の認証や業務ロジックの欠陥を見つけようとする点が違う、と同氏は説明しています。Codex SecurityはChatGPTの有料プラン向けにリサーチプレビューとして、Claude SecurityはClaude Enterprise向けにベータ版として提供されています。5

記事では、AIの修正案を人が確かめ、テストしてからマージする手順を示しています。同氏は、最終判断は人が下すべきだとしています。5 脆弱性診断を外部に委託するか内製するかを検討するときの下調べに役立つ記事です。AIにレビューをさせるときの権限の絞り方は、当サイトの「書き込みツールを外して書けないことを確かめる」に書きました。

ある開発チームのLLMの使い分け、クラウドと手元のマシン2台

V氏が、自身のチームのLLMとツールの使い方を記録した記事です。チームではOllama Cloudの月500ドルのTeamプランを契約し、全員がDeepSeek V4.1 FlashとGLM 5.3 Flashを使う形に切り替えました。月500ドルで1,000ドル分を使えるといいます。DeepSeekの混雑する時間帯(日本時間21時〜翌3時)が営業時間と重ならない利点もあると書いています。Claude Codeの契約は、同氏の評価用の1人分だけを残し、ほかは解約しました。6

手元では、Lenovo ThinkStation PGX 2台でDeepSeek V4 Flash Vision Expを動かしています。クラウドで使うDeepSeek V4.1 Flashより版が古い、V4系の画像も扱えるモデルです。GitHub Actionsのセルフホストランナーと組み合わせ、コードとIssueのレビューを自動で回しています。6 クラウドのLLMとローカルLLMのコストを比べるときの参考になります。

Claude CodeとCodexの利用枠は、何で減っているのか

利用枠が何で減っているかを、筆者が自身の利用記録から確かめた記事が2本出ました。1本目は、CodexでGPT-5.6 Solを使った26日間・8,096回のリクエストを分析しています。入力のうち、キャッシュ(前に送った内容を再利用する仕組み)から読んだ分が96.8%でした。キャッシュ読み取りの単価は通常の入力の10分の1ですが、量が多く、消費全体の66%を占めました。7

同じ記事は、Claude Codeのログも調べています。60〜120分あけて再開したリクエストでは、キャッシュヒット率が5.9%まで落ちていました。対策として挙げているのは次の3つです。7

  • コンテキスト使用率70%を目安に、セッションを切り替える
  • テストの実行結果のような長い出力は、サブエージェントに任せる
  • 1時間(Codexは30分)以上あいたら、新しいセッションで始める

先週のまとめで紹介した、キャッシュヒットの有無でOpus 5.5の費用が変わるという検証とも合致します(9月第4週の技術トレンド)。

2本目は、Claude CodeをMax 20xプランで使い、リクエストごとの使用量を記録して計算式を推定しています。モデルごとの重みは、Haiku 4.5を1とすると、Opus 5.5が2.2、Opus 5が2.75、Fable 5.1が10でした。APIの単価の比ではOpus 5.5が4、Opus 5が5なので、どちらも重みは単価の比より小さくなっています。8

同じ量のトークンでも、ヘッドレス実行(対話をしない使い方)は対話よりも速く5時間枠を減らします。ピーク外は対話の2倍、平日のピーク時間帯(日本時間21時〜翌3時)は2.86倍でした。tksfjt1024氏は、重みはMax 20xで求めたもので、ほかのプランでは確かめていないと注記しています。8

出典

  1. 大賀愛一郎「AI-Slopな日本語を構造レベルで読みやすくするSkill『yomiyasu(よみやす)』を作りました」(Zenn、2026年10月1日)(参照 2026-10-04)
  2. inoyu-qiita「新しい日本語推敲スキル「yomiyasu」がバズっていたので、Claudeで日本語推敲スキル3つを比べてみた」(Qiita、2026年10月1日)(参照 2026-10-04)
  3. ABAB↑↓BA「AI開発時代だからこそ、テストの役割を見つめ直す」(Zenn、2026年9月29日)(参照 2026-10-04)
  4. 田邉優汰「AI 駆動開発で「設計」はどこに書くのか ― 振る舞いをテストで検証できる「仕様」にしてみる」(Zenn、2026年9月29日)(参照 2026-10-04)
  5. npaka「Codex Security ・ Claude Security 入門」(note、2026年10月1日)(参照 2026-10-04)
  6. V「2026 年 10 月前半の LLM 利用状況」(Voluntas、2026年10月3日)(参照 2026-10-04)
  7. hanafusay「Claude Code / Codexで「私のlimit、減りすぎ…?」と思ったときに見る記事」(Zenn、2026年9月29日)(参照 2026-10-04)
  8. tksfjt1024「Claude Code の使用量はどう数えられているのか ── Max 20x で実測した重みは API 料金表と違った」(Zenn、2026年10月1日)(参照 2026-10-04)

任せる

AI秘書に任せる

問い合わせの受付から請求書の作成までの業務を、AIで自動化します。

できることを見る 相談する(初回無料・30分)