Kajitaka @kajitaka.bsky.social · 30/09/2026遂にGemini 4シリーズ発表 Gemini 4 Argonについての情報が公開された 性能はベンチマークを見る限りFableやAstraに匹敵していそう 価格はインプット/アウトプットが4$/20$(導入期間は2$/10$に値下げ) アウトプットは100万トークンまで出力できるようになった まだ一般ユーザーは使えず、信頼できるテスターとかに提供しているところ 少しずつ提供範囲を広げていくらしい Googleがフロンティアモデルの競争に戻ってきた 130
Kajitaka @kajitaka.bsky.social · 29/09/2026HumanBenchなるものがあったので、やってみた AIのベンチマークみたいなやつを解いて、どれくらいのパラメーター数かどうかを判定するやつ やってみたら、1Tパラメーターとのこと GPT-5味があると言われた ネタとして面白かった 以外に時間がかかって、途中でJevで簡単なものをスキップする機能を使った humanbench.ybuild.ai/ja/ 032
Kajitaka @kajitaka.bsky.social · 22/09/2026Claude Opus 5.5 ArtificialAnalysisのベンチマークを見ると、Opus 5から性能が大幅に向上し、Fableをも上回る結果を出している API価格も20%引きとなったが、トークン使用量も増え結局は値段は同じくらいになってしまっている 今まではAPIの価格は上がる一方だったが、トップ2社が価格を下げる方向に進んでいて、コスパも注視しているのが分かる 個人的にはトップモデルが必要なことは多くなく、それなりの性能のモデルが安く使えるなら歓迎する 050
Kajitaka @kajitaka.bsky.social · 22/09/2026GPT-6 Sol, Luna 噂通り発表された Terraが消えるというのも噂通り ArtificialAnalysisのベンチマークでは性能はそれほぼ変わっていない 一方、APIでは半額くらいになっていて、コストパフォーマンスがいいモデルとなっている トークン使用量も大きくは変わっていなくて、APIの値下げは直接感じられるはず Astraもでて、Terraの立ち位置が微妙になったのだろうが、このように命名法則がすぐに変わっていくと追っている側としてはやりづらい Claude Opus 5.5も同日に発表されていて、Grok 4.7も先日発表されたし、競争が激化している 060
Kajitaka @kajitaka.bsky.social · 19/09/2026OpenAI、Anthropicとかに続いてGoogle Geminiも他社システムに侵入していたと分かった 設定のミスでネットにアクセスできていた 自分で気付いて停止したというのは他社モデルではなかった挙動でそこは安全性が高いといえる 侵入方法が脆弱性の発見ではなく、パスワードの推測やネットで公開されている認証情報の使用であったのはある意味危険 これは、脆弱性が発見できなくてもシステムに侵入できるということ 今後はAIを使った攻撃の防御として、脆弱性を潰すだけでなく、パスワードの強化とかも必要になってくる AIで脆弱性が見つけやすくなっても最大のセキュリティホールは依然として人間 030
Kajitaka @kajitaka.bsky.social · 03/09/2026GPT 6 Astraが発表されていた 触れたいのがARC-AGI-3 OpenAIが作ったハーネスでは98.6%を記録し、ベンチマーク作成側のハーネスでも62.71%を記録 今までの最高値がClaude Opus 5の30.16%だったので驚異的 タスクごとに見ていくと、100.0%のものから0.0%のものまである 100.0%のものはそのタスクを知っていたのではないかというレベルで、逆に0%のものはどう考えてもそうはならないという挙動をしていた 比較をすると、とても同じモデルとは思えないくらい差があった 173
Kajitaka @kajitaka.bsky.social · 02/09/2026Muse Spark 1.3 ArtificialAnalysisのベンチマークを見る限り、ClaudeのFableとOpusの間の性能 価格はClaude系等の同等性能のモデルと比較すると相当安い(xhighですらGemini 3.8 FlashやGPT 5.6 Terra(max)の同じくらい) また、スピードも速い(GeminiのFlashに匹敵するくらい) 1Mあたりの価格も性能にしては相当安く設定されている Muse Codeも発表し、本格的にAnthropicやOpenAI2対抗してきた 性能も問題なく、その割に速度が速く価格が安い トップモデルの競争にMetaが参入してきた 050
Kajitaka @kajitaka.bsky.social · 02/09/2026Gemini 3.8 Flash 公式声明: * 先代のモデルから推論とコーディング能力が上がった * スピードと値段は変わらない(割引されているのも継続) * 性能上昇のためにトークン使用は増える可能性あり(効率を求めるならeffort levelを下げるか3.7を使ってくれとのこと) * サイバー能力を身に着けたモデルも開発(Fairwind Programに参加する企業のみに限定公開) 下にベンチマークの結果をまとめたもの 130
Kajitaka @kajitaka.bsky.social · 01/09/2026AnthropicがClaude Fable 5.1とMythos 5.1を発表 公式声明: * キャシュの値段を下げるから、実際の費用は約25%安い * Fableのセーフガードは緩めた * EUの法律によりウォーターマークを追加(性能への大きな影響はなくユーザーや組織、会話情報は含まれていない) ArtificialAnalysisのベンチマーク: * 多くの指標において現在のトップモデルを上回る * Anthropicの公式声明に反してアウトプットトークンの増加により費用も上昇(ベンチマークは一般的なタスクではないためこの数値を鵜呑みにするべきではないが、こういう結果が出たのも事実) 030
Kajitaka @kajitaka.bsky.social · 13/08/2026Gemini 3.7 Flashが発表されていた ArtificialAnalysisのベンチマークを見る限りは、性能はあくまでFlashレベル OpenAIとかAnthropicの上位モデルには届かない その代わりに、値段を安くして(3.6の半額)、速度も速くなっている(340tokens/s) 気になるのが、価格が半額なのは今年だけらしいというところ どうせ、来年になるまでに、4シリーズのFlashがでているだろうから、この今年だけという制約がいまいち理解できていない 紹介のところに、Proを出すという文章も消え、リーク通り、3.5 Proは消えて、4シリーズに注力しているのかも 130
Kajitaka @kajitaka.bsky.social · 12/08/2026AnthropicがClaudeのテキストにウォーターマークを入れると発表した件について 個人的には賛成 でも、SNSではユーザーが1番損をするとか、AnthropicはオープンソースのAIに人を流したいのかとかの反対意見がある 性能に関しては、既に導入しているGoogleで大きな問題が起こっていないからそれほど問題にはならないはず もちろん、校正に使っただけで透かしが入ってしまって全てAIに丸投げしたと思われるとか、問題は存在する でも、AI Slopという単語ができる時代に、生成AIかどうかを確認できるようにするという方向性自体に間違いはないように思っている 140
Kajitaka @kajitaka.bsky.social · 31/07/2026OpenAIのモデルがHugging Faceに侵入したということに対抗してAnthropicが自社のモデルも実世界でサイバー攻撃ができる能力があると宣伝している OpenAIのときにも思ったけど、これって逆効果なのでは いかに自社のモデルが危険かというものを宣伝してどうなるの 普通に使っていたら、外部のサイトに侵入していたと言われるかもしれないモデルは使いたくないのだが 宣伝するとしても、ベンチマークを測定していたら外部システムに侵入していた事例ではなく、Mythosの時の様な脆弱性の発見とかで済ませてほしい www.anthropic.com/news/investi...anthropic.comInvestigating three real-world incidents in our cybersecurity evaluationsIn a review of our cybersecurity evaluation transcripts, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environmen... 030
Kajitaka @kajitaka.bsky.social · 30/07/2026GoogleがLyria 3.5を発表して、Google Flowで使えたので試してみた 会話形式で曲が生成できるという機能を使った どんな感じの音楽を聞いているかという質問に、「J-Pop music」と回答したら、以下の楽曲が生成された リズムとかコードとかは詳しく分からないが、BGMとしては成立しているように思える 生成までには少し時間がかかったが、長いと感じる時間でもなかった 日本語の歌詞をその後入れさせた時に、若干不自然な部分があったから、日本語はまだ完璧ではないっぽい www.flowmusic.app/song/1597619...flowmusic.appTokyo Neon Night by KajitakaListen to this creation on Google Flow Music 161
Kajitaka @kajitaka.bsky.social · 21/07/2026Gemini 3.5 Flash GeminiアプリでCanvasで電卓を作らせた 前回のはCanvasではなかったらしいので、ちゃんとCanvasでやってみた - 速度は速い - ボタン配置もデザインも問題なさげ(ダークモードとの切り替えも可能) - 履歴機能はアニメーション付きで出てくる Flash-Liteでもそれなりのものが出てきたので、これだけでは判断できないというのが現状 スピードは速くなっているように感じられるので、そこは現状わかる範囲でも、いい点と言えそう 030
Kajitaka @kajitaka.bsky.social · 21/07/2026Gemini 3.5 Flash-Lite ArtificialAnalysisのベンチマーク結果を見ると、3.1からは性能は上がり、アウトプットトークンも減っているが、1Mあたりの価格が上がっているから、全体としては価格が上がっている 電卓アプリ(GeminiアプリでCanvas) - 基本的な計算はできる - 関数電卓の機能もついていて、押すと三角関数と根号が使える - 履歴機能が付いている 実行いてみた感じ、Flash-Liteの速度を保ちつつ、それなりに使えるものが出てきた 今やこれくらいのモデルでも電卓が作れるというのは進化を感じる 020
Kajitaka @kajitaka.bsky.social · 21/07/2026Gemini 3.6 Flash ArtificialAnalysisのベンチマーク結果では、性能は3.5 Flashと変わらず、速度が速くなり、トークン使用が抑えられている 価格も若干だが安くなった 電卓を造らせた結果 (アプリでCanvasを使って実装) - 動きはするが、ボタンの配置が気になる - ボタンも小さく押しづらい(特にスマホ) - 下の「LAST RESULT」は、便利だが足し算をしようとすると更新されるので、このままだと使い道がなさげ コーティング性能が大幅に改善しているという感じはなく、あくまでもトークンを大量に使用するという部分を修整したという位置づけに感じる 230
Kajitaka @kajitaka.bsky.social · 09/07/2026GPT-5.6シリーズが発表されていた ArtificialAnalysisのベンチマーク結果を見る限り、Solの性能はFableに匹敵と言ってよさそう でも、個人的には、性能よりも、コスパの方が重要に感じる Fableと同等のSolは、Fableの3分の1のコストで、ArtificialAnalysisのベンチマークを実行したという 性能も重要だけど、一般ユーザーは、それと同じくらいコスパが重要 最近のモデルは、性能は良くなっているものの、トークン使用量が増え、結局かかる費用が上がるという現象が起こっている その中で、コスパのことを考えて作られたモデルは重要な意味を持つと思う 050
Kajitaka @kajitaka.bsky.social · 22/06/2026今日、sakana.aiがFuguというモデルを発表した GPTとかClaudeとかGeminiとかのモデルを裏で走らせて、その回答を合わせるみたいな仕組みっぽい 結果としては、一部のベンチマークでClaude Fable 5を上回る得点を記録し、ベンチマーク以外の実務タスクでもアメリカのトップモデルに匹敵、上回るらしい ようやくsakana.aiの本領が発揮された感じ(元々、AI業界でスイミーをやろうとしていたし) sakana.ai/fugu/sakana.aiSakana Fugu — Multi-agent System as A ModelOne model to command them all 140
Kajitaka @kajitaka.bsky.social · 31/05/2026Noteを書きました Google I/O 2026の中で気になったものをまとめてみました よかったら、皆さんが気になったものを書いていただけると嬉しいです note.com/kajitaka1201...note.comGoogle I/O 2026で気になったもの|kajitaka2026年5月19・20日(現地時間)、Google I/O 2026が開催されました。 今回は、そこで発表されたものの中から、個人的に気になったものをまとめてみます。 最初に、発表されたものの一覧と一文での説明を書いた後に、気になったものを詳しくまとめます。 情報元は、YouTubeのGoogleチャンネルの、"Google I/O '26 Keynote"です。 適宜、目次を使ってお読... 040
Kajitaka @kajitaka.bsky.social · 25/05/2026Bunを使っている身としては、この反応には同意する Bunのチームが、Anthropicに入って、AIを使うこと自体は問題ない(そもそも、AIを使わないプロジェクトの方が少ないと思う) でも、Claude Codeに丸投げした、100万行単位のプルリクエストをすぐにメインブランチにマージするのは、どうなのかなと思っていたところ もちろん、この人たちは、確実に自分より技術力があるわけで、自分は何かを言える立場にはないけど、この後の安定性が信頼できなくて、npmとかpnpmとかに戻ろうかなと考えている その中で、Bunを非推奨化するという決断を取ったこのサービスには同意する 030
Kajitaka @kajitaka.bsky.social · 23/05/2026Xで言われていたことを試した GeminiアプリのGemini 3.5 FlashとGemini 3.1 Flash-Liteが簡単な計算ができないという趣旨の投稿 思考レベルを標準にして試してみた 結果は、どっちも失敗し、投稿は正しかった Proと、思考レベルが拡張の時は正しく動作する AI Studioだと、FlashはThinking Levelがminimalでも、正しく回答する AI Studioでは、正しく答えるのに、アプリ版だと間違うというのが気になる 340
Kajitaka @kajitaka.bsky.social · 20/05/2026Gemini 3.5 Flash Google I/Oにて、Gemini 3.5シリーズのFlashモデルが発表された Gemini 3.1 Proに匹敵する能力だが、スピードが速いという謳い文句 電卓を作らせた結果↓ 130
Kajitaka @kajitaka.bsky.social · 06/05/2026Noteを書きました OpenAIとMicrosoftのパーチナーシップの改定についてです これが、両社及び、他のAI業界の企業へどの様な影響があるのかについて意見を書いてみました note.com/kajitaka1201...note.comOpenAIとMicrosoft パートナーシップ改定|kajitakaはじめに 2026年4月27日、OpenAIとMicrosoftは、以前までの契約の修正を発表しました。 そこで、OpenAIとMicrosoftとの独占契約も修正されました。 具体的には、OpenAIは、Microsoft Azure以外のクラウドサービスを利用し、サービスを提供することができるようになりました。 また、Azure以外のクラウドプロバイダーもOpenAIのモデルを提供でき... 050
Kajitaka @kajitaka.bsky.social · 27/04/2026毎年行われている、AIに東大の問題を解かせたというものの今年分が出ていた 京大もやったらしく、当たり前のように首席を超えているのがやばい それぞれの教科へのコメントみたいな部分で、それぞれのAIの強み・弱みが説明されているのが役に立ちそう note.com/lifeprompt/n...note.com【首席超え・満点続出】2026年度 東大・京大の入試問題をAI(ChatGPT / Gemini / Claude)に解かせてみた【採点協力:河合塾】|遠藤聡志 | LifePrompt, Inc.昨年、AIが東大理三合格点に達したニュースは大きな話題を呼びました。 あれから1年——AIの進化はとどまるところを知らず、ついに首席超えを達成しました。 2026年度の東大入試、理科三類の合格者最高点は 453.60点(550点満点)。これに対してChatGPTは503.59点、Geminiは496.54点と、いずれも首席の点数を50点近く上回りました。 京大医学部でも同じ傾向が見られます。... 031
Kajitaka @kajitaka.bsky.social · 26/04/2026Noteを書きました Tesla、SpaceX、xAI共同のプロジェクトTerafabについてです 簡単に言うと、アメリカ版のTSMCを作ろうというプロジェクトです 今回はそのTerafabについて、実現可能性と実現した時の影響について、意見を書いてみました note.com/kajitaka1201...note.comTeslaなどによるTerafabについて|kajitakaはじめに 2026年3月21日、Terafabというプロジェクトが発表されました。 Terafabは、Tesla、xAI、SpaceXの3社によるAI用半導体の製造プロジェクトです。 宇宙データセンターと人型ロボット用のAIチップを生産することが予定されています。 4月7日には、Intelの参画も発表されています。 今回は、そのTerafabというプロジェクトについて軽く説明した後に、実... 030
Kajitaka @kajitaka.bsky.social · 24/04/2026DeepSeek V4 ProとPro Thinkingに原稿用紙プレビューアプリを作らせた Pro * 原稿用紙が正方形で横書き(横長で縦書きを想定) * ページは1ページまで * 句点などが行の始めにある場合には赤く表示される(前の行の後ろに入れて欲しかった) Pro Thinking * 原稿用紙は正方形で横書き * 複数ページを対応しているけどボタンでの行き来が必要 * 行末の句点は最後のマスに表示されているが、場所がおかしい * 升目サイズという謎の設定が可能(いらない) どちらも、このレベルのタスクは難しいらしい アメリカ企業の1つ前のモデルみたいな結果になった 130
Kajitaka @kajitaka.bsky.social · 24/04/2026DeepSeek V4を使ってみた Arena.ai のCodeで電卓アプリを作らせた * Pro, Pro Thinkingは完璧(0除算、浮動小数点数計算に対応) * Flashは0除算は完璧だが、浮動小数点数計算は小さい数同士をかけ合わせると0になる * Flash Thinkingは一部の計算でバグが発生 今までは、HTMLに全て書かせていたけど、ArenaのCodeモードは、React系の環境があって、それを編集するという形 なぜかアメリカ系のトップモデルが同環境で使えないから直接の比較はできないが、大きな差は感じないarena.aiArena | Benchmark & Compare the Best AI ModelsChat with multiple AI models side-by-side. Compare ChatGPT, Claude, Gemini, and other top LLMs. Crowdsourced benchmarks and leaderboards. 020
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2 vs Nano Banana 2 画像編集のタスクを試した 桜の写真がボケていたから、それを修正させた 画像1枚目が元画像、2枚目がGPT Image 2、3枚目がNano Banana 2 * GPTは色味が変わっているけど、ボケはなくなている * Nano Bananaは色味とかは元画像と似ているが、その分ボケの修正も甘い GPTは、新しいバージョンになっても、性格は変化していなさそう 元画像のいち部分を直してほしいとかのようなタスクだと、依然としてNano Bananaの方が得意 ただ、スタイルを変えたりするタスクは、GPTの方が得意 030
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2 vs Nano Banana 2 プロンプト:「一条煌という名前のVTuberのロゴ」 Xにて、GPT Image 2が噂されていた時に、VTuberのロゴを生成させていて、GPT Image 2の性能の高さを投稿していた人がいたので、やってみた 名前を生成するサイトに適当に名前を作らせた 確実に、品質はGPTが上 やっぱり、Nano BananaはAI感が抜けていていなくて、GPTはそれが抜けた感じがする 150
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2 vs Nano Banana 2 プロンプト:「AI時代に1番必要なプログラミング言語は」というタイトルのブログのヘッダー画像 * GPTはシンプルできれい * Nano BananaはAI感がすごくする(問題はない) * どちらも文字とかで大きな破綻なない * プログラミング言語のロゴはNano Bnanaが正確 * 画面内のコードがどちらもAI系(GPTはOpenAIのapiでNano Bananaはtensorflow) 個人的な好みとしては、GPTの方が好き タイポグラフィはGPTが追い越したという感じ 180
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2 vs Nano Banana 2 プロンプト:「「$\sqrt{2}$ は有理数か」という問題を先生が解説している 後ろの黒板には、証明が最後まで書かれており、生徒が黒板を移せるように、先生は端に寄っている」 * 証明はGPTの方が正確 * GPTは塾、Nano Bananaは学校の感じ(イメージしていたのは学校だけど、塾でもプロンプト上は問題ない) * Nano Bananaの主張は「無理数である」↔GPTの主張は「有理数ではない」(Nano Bananaの方がいい) Nano Bananaは数学の部分で限界が来ている GPTは、まだ大きな問題はない 020
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2 vs Nano Banana 2 プロンプト:「解の公式を証明する黒板をスマホで縦長でとった写真」 * どちらの証明も問題なさそう * 黒板に書いてあるという指示を守っているのはGPT * GPTのアスペクト比は一般のスマホで取れるものではない * Nano Bananaはほぼ9:16で普通のアスペクト比 * どちらも、普通の黒板では書ききれなさそうな行数 スマホで縦長でとった写真という指示で一気に難しくなっている 確実に、GPTは前モデルから日本語の描画能力が上がっている 030
Kajitaka @kajitaka.bsky.social · 22/04/2026GPT Image 2が出ていたので使ってみた Arena.ai にて、Nano Banana 2と比較した プロンプト:「AIの仕組みを解説する4枚のスライドを並べたもの」 * スライドっぽいのは、GPT * 4枚をまとめている様に見えるのはNano Banana * どっちの文字もちゃんと読める(どっちも若干の破綻はあって、より破綻が多く見えるのはNano Banana) * 内容はGPTの方が上(どっちも細かいところでツッコミどころはあるけど) ArenaとかSNSの評価を見ていると、こういうタイポグラフィだと、GPTに軍配が上がる 050
Kajitaka @kajitaka.bsky.social · 17/04/2026これめっちゃ共感した。 最近、AIが書いたということが分からないように修正する(AI臭を消す)ということがなされているが、それに対して意義を問うているもの。 AI臭を消す方法とかを見ていた時に感じていたものを、上手く言語化している。 zenn.dev/acntechjp/ar...zenn.devそのAI臭を消す努力は、誰のためにやっているのか 040
Kajitaka @kajitaka.bsky.social · 12/04/2026Noteを書きました。 先週発表されていたMythos関連の話です。 AGI関連についても触れています。 note.com/kajitaka1201...note.comAnthropicのMythosとProject Glasswingから考えたこと|kajitakaはじめに 2026年4月7日、Anthropicは、Mythosというモデルを一部の企業へのプレビュー版として公開しました。 このMythosは、同社の最新モデルClaude Opus 4.6を圧倒する性能を有し、特にサイバーセキュリティにおいては、人間の専門家と同等の技能を誇っています。 Anthropicは、同時に、このMythosをサイバーセキュリティ分野の防御面で使用するために、Pr... 050
Kajitaka @kajitaka.bsky.social · 11/04/2026Muse Sparkに原稿用紙プレビューアプリを作らせた。 * プレビュー画面が切れている * プレビューは縦長(普通は横長だと思う) * 縦長の都合上、よく分からない縦書きになっている * 1マスに2文字入れる部分が、文字の大きさを小さくして無理やり入れている * 読点とかぎ括弧は2マス使用している * 複数ページを対応していない やはり、プログラミングは強くはなさそう。 他のモデルも、完全に成功したものはなかったが、それでも、最新のトップモデルとしては、最下位。 プログラミングを重視していないだろうし、順当な結果ではある。 040
Kajitaka @kajitaka.bsky.social · 11/04/2026MetaのMuse Sparkに電卓を作らせてみた。 Arenaで、「電卓を作って。」というプロンプトで作らせた。 * =ボタンが1つだけ最下段にあるのは気になるけど、ボタンの配置に大きな問題はない * 四則演算は可能 * キーボードショートカット、0除算には対応 * 浮動小数点数は、切り捨てて対応 * 複数の演算子を入力できるバグが存在(キーボードショートカットのみ) 電卓だけで言うと、他のトップモデルよりは劣った結果となった。 速度は見ていなかったけど、遅くはなかった。 Metaの復活の象徴のモデルとしては、悪くない感じ。 030
Kajitaka @kajitaka.bsky.social · 04/04/2026Noteを書きました。 少し前となりますが、Rakuten AI 3.0が出て、DeepSeek V3ベースじゃないかと言われたことについてです。 国産AIとかの意義とかについても書いています。 note.com/kajitaka1201...note.comRakuten AI 3.0から考えたこと|kajitakaはじめに 2026年3月17日、楽天が、同社の最新のLLMとして、「Rakuten AI 3.0」を発表しました。 性能面ではGPT-4oに匹敵するとのベンチマーク結果が出ましたが、一部では批判も存在します。 批判の内容としては、楽天の情報公開に関してや、「国産AI」や国の投資への意義等が多かったです。 今回は、この事例を扱い、同様の事例ではどうするべきなのかと、国産AIの意義などについて... 071
Kajitaka @kajitaka.bsky.social · 04/04/2026Gemma 4 E2Bに電卓を作らせた 先日発表されたGemma 4シリーズの中で、最もモデルサイズが小さいもの Google ColabでThinkingをオンにして実行した プロンプト:「電卓アプリを作って。」 * ボタンの配置が少しおかしい(特に"+"の位置と色) * 四則演算は普通にできている * キーボードショートカット、浮動小数点数計算、0除算への対応はなし 電卓としては、ぎりぎり使える程度 モデルサイズとしては、スマホとかで走るくらいなので、それでこのレベルの物ができたのは驚き 140
Kajitaka @kajitaka.bsky.social · 03/04/2026Gemma 4に電卓アプリを作らせてみた GoogleのオープンモデルのGemmaシリーズに4が出たので、電卓アプリを作らせた Arena.ai にて、31B Denseと26B MoEを試した どちらとも、ほぼ同じ結果となった * 速度は、モデルサイズが小さいだけあり、速い * CoTの技術も使っていそう(16秒考えた) * ボタンの配置は使えないほどではないが、気になる * キーボードショートカット、浮動小数点数計算、0除算には対応なし 最低限の機能を備えた電卓が出てきた 最先端のモデルと比べると、品質は劣っているが、ローカルで動かせる範囲だと考えると、これでもすごい方だと思う 160
Reposted by Kajitaka日経電子版 @nikkei.com · 24/03/2026OpenAI、動画AI「Sora」の提供終了 www.nikkei.com/article/DGXZQO... 今後の新規株式公開(IPO)計画やアンソロピックとの競争激化を踏まえ、収益性の低い事業を縮小します。 Soraを巡っては著作権侵害などの批判も出ていました。 #ニュースnikkei.comOpenAI、動画AI「Sora」の提供終了 著作権侵害に批判も - 日本経済新聞【シリコンバレー=山田遼太郎】米オープンAIは24日、動画生成AI(人工知能)「Sora(ソラ)」のスマートフォンアプリの提供を終了すると発表した。今後の新規株式公開(IPO)計画や米 05958
Reposted by KajitakaGIGAZINE @gigazine.net · 24/03/2026児童保護をインターネットアクセス制御に変えてはならない gigazine.net/news/20260325-child-pr…gigazine.net児童保護をインターネットアクセス制御に変えてはならないDevuanの創設者であるヤロミル氏が、「児童保護をインターネットアクセス制御に変えてはならない」と指摘しています。 0123
Kajitaka @kajitaka.bsky.social · 24/03/2026Sakana AIのSakana Chatというサービスを使ってみた。 Sakana AIが作成して、今回発表したモデルは、以下の3つ - Namazu-DeepSeek-V3.1-Terminus - Llama-3.1-Namazu-405B - Namazu-gpt-oss-120B Sakana Chatで使われているモデルは、名言されていなさそうだけど、DeepSeekベースのやつだと思われる。 公式言っている通り、政治的なバイアスは弱くなっていそう(領土問題とか天安門事件にも答えた)。 ちょっと使った感じで、日本語が不自然に感じることはなかった。 191
Kajitaka @kajitaka.bsky.social · 22/03/2026Noteを書きました。 OpenAIがコーディングと消費者向けを注視するという方針転換をするのではないかという報道を受けて、OpenAIの未来について予想を書きました。 note.com/kajitaka1201...note.comOpenAIの未来|kajitakaはじめに 3月16日、The Wall Street Journalが、OpenAIの今後の方針についての記事を公開しました。 その記事によれば、OpenAIは、コーディングや企業向けに注視するそうです。 今回は、この報道を受けて、今後、OpenAIはどうなっていくのかについて、自分の意見を書くつもりです。 まず、現状、その後報道の内容を書いた後に、今後の予想を書きます。 現状 まず、... 020
Kajitaka @kajitaka.bsky.social · 20/03/2026Mai Image 2 vs Nano Banana 2 Arenaで日本語の描画も試してみた。 内容としては、「AIの仕組み」と書かれたスライド。 * 生成速度はほぼ同じ * Maiはシンプル、Nano Bananaは色々書かれている(指示を出さなかったのでどちらでもいい) * どちらも漢字、ひらがなは読めるレベル * Nano Bananaは若干中国語っぽい漢字が存在 * Maiは正方形だが、Nano Bananaは横長 * Maiは文字の位置が中央じゃない Maiも日本語の描画は結構出来そう。 比率が1:1しかないのか、正方形のため、スライドとしては使いづらい。 050
Kajitaka @kajitaka.bsky.social · 20/03/2026Mai Image 2というモデルが公開されていたので使ってみた。 Microsoftが作成した画像生成AIのモデル。 ArenaでAIの仕組みを説明する画像を作らせて、Nano Banana 2と比較した。(画像1枚目がMai Image 2、2枚目がNano Banana 2、プロンプトは画像のALTに記載) * スピードに大きな差はない * どちらも文字に大きな破綻なし * Maiは情報量が少なく、AIの仕組みを説明しきれてない * Nano Bananaは、概ね大丈夫 抽象的な指示だと、Nano Banana 2の方が上。 日本語とかも試してみる。 040
Kajitaka @kajitaka.bsky.social · 15/03/2026Noteを書きました。 YouTubeで見つけた動画から自分の意見について書いています。 動画のURL: youtu.be/g9UIamT4Pgc note.com/kajitaka1201...note.comAI時代に1番必要なプログラミング言語は|kajitakaはじめに 今回は、YouTubeで見つけた動画から、自分の意見を書いてみようという趣旨の記事です。 見つけたのは、IBMのチャンネルに投稿された、「Best Language for AI: What You Need to Know」です。 タイトルの通り、AI時代に最も必要な言語についての動画です。 まず、元の動画の内容を軽くまとめた後に、自分の意見を書きます。 扱った動画とその内容... 021
Kajitaka @kajitaka.bsky.social · 08/03/2026Noteを書きました。 Anthropicとアメリカ国防総省の対立の話から、AIの規制について意見をまとめたものです。 note.com/kajitaka1201...note.comAIの安全性と規制|kajitakaはじめに 最近、アメリカで、生成AIの軍事利用に関して、Claudeを開発するAnthropicと国防総省の対立が話題になっています。 そこで今回は、AIの危険性と、どの様に安全性を保つべきなのか(規制)について、自分の意見を書いてみたいと思います。 最初に、今回の騒動について軽く説明した後に、AI開発の安全性と、AIの軍事利用に関する安全性の2つについて意見を書きます。 今回の騒動につい... 050
Kajitaka @kajitaka.bsky.social · 06/03/2026GPT 5.4に原稿用紙アプリを作らせた。 Arenaでgpt-5.4-highで試した。 * 時間は結構かかった * "。"は改行せず一番下に表示されるけど、"。」"は2マスになってしまった(原稿用紙のルールは完全には理解できていないっぽい) * 改行の部分に自動で空白が入る(便利な点もあるけど不便でもある) * 括弧は横書きの際のまま * 20x20だけど、周りの余白が均等なので、原稿用紙には見えない * 2枚目が画像で保存した際のものだけど、該当部分をスクショした感じ GPT 5.4(high)でも、まだ原稿用紙のプレビューアプリとかだと難しいらしい。 040
Kajitaka @kajitaka.bsky.social · 06/03/2026GPT-5.4が発表されていてので、電卓を作らせた。 Arenaでgpt-5.4-highで、プロンプトは「電卓アプリを作って。」で試した。 *スピードは、遅くはない * ボタンの配置は少し気になる * 0除算と浮動小数点数には対応(ただ0に近い数同士の掛け算では0となる) * キーボードショートカットには対応している このタスクだとやっぱり、このレベルのモデルの比較はできない。 前回Gemini 3.1 Proでやった原稿用紙のタスクをやってみるつもり。 030