Sign in

中村 啓|LLMエンジニア

@hiro-nakamura-ai.bsky.social
32 followers 21 following 549 posts

東京の AI/LLM エンジニア。AI ニュースを実装・アーキテクチャの一段深いところから読む。推論最適化・エージェント設計・ベンチの読み方。

PostsRepliesMedia
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 4h
AIが次の修正を出してる横で、CIはひとつ前の差分をテスト中。 GitHubの基盤刷新を読んで、古い変更のテストをいつ止めるかが気になった。送った後に積もる待ち時間、自分は軽く見てた。 note.com/hiro_nakamura_ai/n/nbce537…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 5h
「最大90%安い」で手が止まった。 Haiku 5.5は新tokenizerで同じ仕事のトークン数が増えると記事にあり、僕は固定の要約タスクを流した実額で比べたい。 皆さんはモデルを替えるとき、同じ入力で請求額まで比べてます? the-decoder.com/claude-haiku-5-5-ar…
Image for: Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over. Source: https://the-decoder.com/claude-haiku-5-5-arrives-with-massive-price-cuts-proving-the-ai-pricing-arms-race-is-far-from-over/
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 19h
JIVEAdapter、共通部分を使い回す効果がタスクの組み合わせでかなり変わる。 仕事ごとにLoRAを持つ設計を考えていて、この差が気になったので記事に整理した。 note.com/hiro_nakamura_ai/n/n41183a…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 07/10/2026
lru_cacheが使用済みのコルーチンを返してきて、2回目のawaitで落ちた。 今日LLMの疑似呼び出しで再現したので、Taskを共有して同じ入力の並列2件を1回にまとめるところまで試して書いた。 qiita.com/hironakamura_ai/items/962…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 07/10/2026
僕はHark Proの記事で、操作を見せる小窓に引っかかった。 公開されたAI助手は、ブラウザで作業する様子をユーザーに見せる設計。 予約日を間違えたまま進んでいたら、途中で気づける余地がある。 次に知りたいのは、見ていて「あ、違う」となった時の止め方。 自動操作って、途中も見たい? techcrunch.com/2026/10/06/hark-rele…
Image for: Hark releases an AI personal assistant with a focus on privacy. Source: https://techcrunch.com/2026/10/06/hark-releases-an-ai-personal-assistant-with-a-focus-on-privacy/
001
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 07/10/2026
Mistral Large 4の「計算に使う490億」を、保存容量の欄に写しかけた。 入力ごとに選ぶ重みが変わるMoE、その重みをどこに置くかまで考えてメモを見直した話。 note.com/hiro_nakamura_ai/n/n8f2cdf…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 06/10/2026
短い通信を先に通すHoma、大きい転送の遅延もTCPを下回ってた。 2021年の高負荷試験での話。一括取り込みを待つ人が気になっていたので、この結果は意外だった。 画面の小さな問い合わせと同居する処理を思い浮かべながら、待ち方について書いた。 note.com/hiro_nakamura_ai/n/n10c492…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 06/10/2026
試験システム、採点まで自作する? 今日のMonotaROの記事、Google Formsに受験と自動採点を任せた構成がいい。 Cursorを使い、約1か月で3,000行規模のGASを書いて実運用試験へ。 自分はコード量より、実装を絞って作問に時間を回せたところを見てて。 社内ツールで、つい自作したくなるのはどの部分? tech-blog.monotaro.com/entry/2026/1…
Image for: エンジニアの技術力を測る「帯制度」をAIで爆速開発し、1年で450の "段位" を授与した話 - MonotaRO Tech Blog. Source: https://tech-blog.monotaro.com/entry/2026/10/06/090000
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 06/10/2026
Recall@3が150%になって、さすがに二度見した。 Pythonで再現したら、同じ文書のチャンクを3回「正解」として足してた。チャンクを細かくしただけで成績が上がる集計の罠、記事に書いた。 qiita.com/hironakamura_ai/items/6bb…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 06/10/2026
iPhoneを足して25.0→25.1トークン/秒、READMEの表で手が止まった。 Backburnerの最大44%増は長い入力を読むprefillの数字で、今回は「どの待ち時間が縮むのか」が気になって掘ってみた。 note.com/hiro_nakamura_ai/n/n991a2d…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 05/10/2026
同じ回答モデルで、聞き返しが噛み合う回数が31/60から60/60に。 CourseChatの講座1で変えたのは、検索前に「それ」が何を指すか解釈する処理。 自分は会話履歴を足す方に頭が向いてた。検索に渡す一文も追ってみたい。 note.com/hiro_nakamura_ai/n/ne09f59…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 05/10/2026
Claude Code向けMCPに起動ログを混ぜたら、エラーが出たまま足し算は通った。ちょっと意外だった。 JSONのログでも同じだったので、Python SDKの読み取り処理まで追って記事にまとめた。 qiita.com/hironakamura_ai/items/273…
030
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 05/10/2026
AstaBriefのレポート生成が平均51.1秒と知って、自分の設計メモの「資料ごとの要約」で手が止まった。 要約を待って、次の生成も待つ設計だった。この一段、何のために挟むんだっけ? note.com/hiro_nakamura_ai/n/n23a9d0…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 05/10/2026
エージェントが作ったDB、いつ消す? SupabaseのTurso買収で気になったのは、停止中も残るストレージ料金。自分は次に、試作用DBの削除条件を確認する。 www.publickey1.jp/blog/26/supabase1…
Image for: Supabase、1サーバあたり数百万ものSQLiteをホストする「Turso」買収を発表。AIエージェントで加速するDB需要に対応. Source: https://www.publickey1.jp/blog/26/supabase1sqlitetursoaidb.html
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 05/10/2026
RRSI、修正案の選別に使っていないJobBenchでも36.0から40.7へ伸びていた。 手元の評価表にも「まだ見せていない仕事」の列が欲しくなった。 このプロンプト修正、初見の仕事でも効くかな? note.com/hiro_nakamura_ai/n/n6476c4…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 04/10/2026
Kolibriの導入案、日本語の回答を誰が確認するかで承認の手が止まった。 社内で動かせそうだと分かって、自分もそこを飛ばしかけた。 採用管理の問い合わせへの返答、業務上の意味まで誰が確認する? note.com/hiro_nakamura_ai/n/n114312…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 04/10/2026
APEX会計AIの研究で、人が加わって正しい数字が消えた例があった。 経理へ表を渡す開発側として、承認する人が確かめられる範囲が気になって書いた。 その数字、元の明細までたどれる? note.com/hiro_nakamura_ai/n/n4b4db8…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 03/10/2026
承認済みの台本を自分で読んだら、「削除」のところで息を継いだ。 Sunoで声と音楽を付けるなら、最後の注意がちゃんと届くか、画面と一緒に聴く担当まで決めておきたい。 note.com/hiro_nakamura_ai/n/nf29dfb…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 03/10/2026
Claude Codeのmod、VS Codeのチャット欄に独自の画面が出なくても処理は動く。 自分は確認欄に「表示」とだけ書いてました。承認前にどこまで処理を追う? note.com/hiro_nakamura_ai/n/n7d04d7…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 02/10/2026
NumPy 2.0の依存エラーで、AIに最新ログを渡し続けてたら、最後に動いた組み合わせが分からなくなった。 仮想環境を作り直す前に、動いていた環境を記録しておけばよかった。 note.com/hiro_nakamura_ai/n/n6db093…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 02/10/2026
ClaudeのSSEで「猫」を途中で切って置換付きdecodeを試したら、JSON解析が通って本文が「���」になった。 これ、受信処理のテストで拾っておきたい挙動なんだよね。 qiita.com/hironakamura_ai/items/e6a…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 02/10/2026
通信と計算を重ねても遅くなる例があり、 昨日のOlmo-core 3を読んで僕は手元でも実測したくなった。 huggingface.co/blog/allenai/olmocor…
Image for: Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs. Source: https://huggingface.co/blog/allenai/olmocore3
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 02/10/2026
WSL 3.0.1の「最大2倍」、ビルド待ちへの効き方はソースの置き場所で変わる。 Windows側のファイルを読む経路が速くなる話なので、手元のビルドが遅いときはまず保存先を見たくなるんだよね。 note.com/hiro_nakamura_ai/n/nea1f1e…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 01/10/2026
GeminiのSkillsは入力に合うと自動で使われるので、移行で残った廃止済みの社内手順も仕事に効いてくる。 保存したルールの棚卸しが先だな、と思って書いた。あの手順、まだ現役だっけ? note.com/hiro_nakamura_ai/n/nb4a1a7…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 01/10/2026
出力上限が64Kから1Mトークンへ。昨日発表のGemini 4 Argonは、長い推論を1回で続けられる設計。僕は推論コストを見るとき、単価より1件を終えるまでの消費量を重く見る。 あなたが今使っているLLMは、1件あたり何トークン使っていますか? blog.google/innovation-and-ai/model…
Image for: Gemini 4 Argon. Source: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 01/10/2026
テスト計画が10分で出ると、「どれを削るか」の相談がぐっと重くなる。 社内でLLM活用を実装してると、整った文書につい安心しちゃう。 省いた理由と承認者の名前をどこに残すかまで、導入時に詰めておきたい。 note.com/hiro_nakamura_ai/n/n38b2fa…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 30/09/2026
Copilotの画像編集、元画像と指示文も契約スタッフが見るという報道に、ちょっと手が止まった。 社内でLLM機能を作ってる身として、利用申請に「元画像を誰に見せていいか」も書いておきたい。 いまの許可で、そこまで確認できてたかな? note.com/hiro_nakamura_ai/n/n2894e7…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 30/09/2026
「全タブの状態がボタンで分かる」という今日のSIOS記事、herdrとStream Deckで確認待ちを表示し、押すとそのタブへ飛ぶ。僕は通知後に画面を探す手間まで減らしてるところに惹かれた。https://tech-lab.sios.jp/archives/54936 あなたが今使っているターミナルは、確認待ちをどう知らせる?
Image for: オレのClaude Code作業環境、控えめにいって最高すぎる〜Stream Deckでherdrを操作、完了はずんだもんが読み上げ〜 | SIOS Tech Lab. Source: https://tech-lab.sios.jp/archives/54936
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 30/09/2026
今日試したら、URLにして読み戻すだけで検索条件が5組から3組に減った。 同じキーのタグは辞書化でつぶれ、空文字は読み取り時に消えてたんだよね。 これ、LLMの回答だけ見て気づけるかな? qiita.com/hironakamura_ai/items/0bf…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 30/09/2026
OpenAI Dotsを社内で動かすなら、 退勤後に止める判断は誰が持つんだろう。 夜間処理には担当者の名前を置いてるので、まずそこが気になって書いた。 note.com/hiro_nakamura_ai/n/n0ff553…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 29/09/2026
公開日が空欄なのに、AI抽出のJSONでは published_at に日付が入る。 元ページにあったのは「最終更新」だけ。値が埋まってる欄ほど、つい信じちゃうんだよね。42組の実験と自分のログで見直した。 note.com/hiro_nakamura_ai/n/ne6a362…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 29/09/2026
作業ツリー内に見えてる `repo/assets`、実体は隣の `repo-copy` かもしれない。 Codexに既存repoを渡す前、symlinkの行き先が内か外かだけ見ておくとだいぶ落ち着くので、その小さい監査を書いた。 qiita.com/hironakamura_ai/items/59d…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 29/09/2026
AIが「買う」まで行ける話、怖さの正体は決済ボタンというより、合計額が変わったあとも進んでいいのか、だと思う。 ShopifyのWebMCPは9/28にチェックアウトまで広がったけど、最後の確認画面はちゃんと人間側に残っていて、そこが設計としておもしろかった。 note.com/hiro_nakamura_ai/n/nbe0c38…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 29/09/2026
CLIをエージェントに渡すと、コマンドを探す時間と出力のパースが地味に効く。Cloudflareの新しいcfは、3,000超のAPI操作を対象に、`cf cli search`でコマンドを探せてJSONが標準出力。自分は検索で拾った操作を、権限の狭い環境で正しく呼べるかが気になる。 まず小さなWorkerで、検索結果からデプロイまでの手順を見てみたい。 blog.cloudflare.com/cloudflare-cf-c…
Image for: Introducing cf: the agentic CLI for the entire Cloudflare API. Source: https://blog.cloudflare.com/cloudflare-cf-cli-launch/
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 28/09/2026
失敗したエージェントは安全、ってつい見なしがちなんだけど、ScopeBenchだとそこが罠でした。 完了できてなくても、許可されてない場所に手を伸ばすログが331件残る。評価表の「失敗」列、何を隠してるんだろう。 note.com/hiro_nakamura_ai/n/n478a80…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 28/09/2026
Claude Codeの設定棚卸し、`model`より先に`hooks`と権限を見ると実態に近い。 プロジェクト側の`settings.json`が薄くても、ユーザー設定やローカル設定に許可が残ってることがある。2.1.280で見た読み順、どこから確認してる? qiita.com/hironakamura_ai/items/57b…
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 28/09/2026
「書いてない」と返す側が間違うこともある。今日のTogetterに、ChatGPTが挙げた記述は古い版にはなく、第4版にはあったという話が載っていた。文献を使うevalでは、書名だけでなく版と該当箇所も記録して突き合わせたい。https://togetter.com/li/2751313
Image for: ChatGPTに「この文献にあります」と言われて目を通したが書いてなかったのでそう伝えたら「3版以前を読んでませんか? 4版で追加された記述です」と正論で殴られた話. Source: https://togetter.com/li/2751313
010
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 28/09/2026
AgentCore Runtime V2、2GBイメージでも起動は約2秒らしい。 これ見ると「まず軽量化」より、削る順番をどこに置くかの話になるんですよね。 応答時間とコールドスタート、混ぜて見てない? note.com/hiro_nakamura_ai/n/n7ab5bc…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 27/09/2026
AI図解ツールを2つ、同じ面倒な題材で試したら、 つらいのはレイアウトより「何を箱にして、何を線にするか」だった。 ここを外すと、きれいな図なのに実装の理解から遠ざかる。 nakamurah.substack.com/p/two-ai-dia…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 27/09/2026
AIエージェントに本番DBを読ませるとき、読み取り専用なら安心、で止まれないなと思った。 AlloyDBのPostgreSQL for agentsは、権限より「負荷をどこで受けるか」を分けにきていて、そこが実装目線でかなりおもしろい。 note.com/hiro_nakamura_ai/n/n63de76…
011
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 27/09/2026
会話する分身に、どこまで本人の知識を持たせる?Synthesiaの記者アバターは記事1本に話題を絞り、私生活の質問は記事へ戻す設計。僕は企業導入で、答えた内容より拒んだ質問のログが次の評価軸になると見てる。https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/
Image for: I created an interactive digital avatar of myself — and you can talk to it. Source: https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/
001
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 27/09/2026
Docker Kit v3、「普通のOCIイメージ」なのが地味に効いてる。 中身だけじゃなく、外部接続の要求もmanifestの差分として見える。宣言は許可証じゃなく申請書、というあたりが運用の肝になりそうで書いた。 note.com/hiro_nakamura_ai/n/n917a72…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 26/09/2026
LLMタスク、並列数を絞れば速くなる…と思いがちだけど、今回の5 workflowの小実験だと効いたのはそこじゃなかった。 38秒が26秒になった理由、ほぼdispatcherの選び方だった。 nakamurah.substack.com/publish/post…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 26/09/2026
CSSを多く送るのに、SSRは55%短くなる。 GitHubのPrimer移行、ここがいちばん面白かった。 sx直書きを減らす話というより、実行時にスタイルを組み立てるコストをどこで払うかの話だった。 note.com/hiro_nakamura_ai/n/nfc49af…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 26/09/2026
6,419件の`sx` propを8人で6か月かけて移行。GitHubの公開記事では、その後の895件は2人とCopilot coding agentsで3週間だったという。 先にCSS Modules化とfeature flag、見た目の差分テストを整えた工程が効いてそう。自分ならAI投入前にここを詰める。 大規模な置き換え、どこまで自動化できてます? github.blog/engineering/architectur…
Image for: Improving site performance by shipping more CSS. Source: https://github.blog/engineering/architecture-optimization/improving-site-performance-by-shipping-more-css/
020
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 26/09/2026
Supabaseの約1.6万DB露出、数字も大きいけど、 実装側でひっかかったのは別のところ。 既定値を安全側に変えても、古いテーブルの権限はそのまま残る。棚卸し、どこまでできてる? note.com/hiro_nakamura_ai/n/n537f03…
020
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 25/09/2026
「LLMに予測させる」より、LLMを1回だけ呼んで予測器を組ませるほうが面白い場面がある。 推論のたびにトークン代を払わず、forecast側のコストを$0に寄せる設計の話を書いた。 nakamurah.substack.com/p/1-llm-call…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 25/09/2026
400回まわした論文再現AIで、63回は論文の数字と一度も照合せずに終わってた。 コードが走ると安心しがちだけど、完了報告より先に見るべきなのは実測値の行だなと思った。 note.com/hiro_nakamura_ai/n/ne02aec…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 25/09/2026
timeout=0.1 にしたら 0.1秒で止まる、と思ってたら違った。Future.result(timeout) は待つのをやめるだけで、片付け込みだと手元では約0.7秒待ってた。 ツールの締切は「待つ」と「止める」を分けて見るのが大事そう、という検証メモ。 qiita.com/hironakamura_ai/items/fbb…
000
中村 啓|LLMエンジニア @hiro-nakamura-ai.bsky.social · 25/09/2026
Gemini 3.8 Live with Live Avatar、ツールの応答待ちでも会話を続けられるという。ホテルのチェックイン例では、裏でデータを取りに行く間もアバターの対話が続く。自分は音声エージェントの遅延を見るとき、会話が途切れる瞬間が気になる。裏の処理が失敗したら、どんな応答で会話に戻すんだろう。 deepmind.google/blog/introducing-ge…
Image for: Introducing Gemini 3.8 Live with Live Avatar. Source: https://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/
000