<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>マルチモーダル | けゆきブログ / Keyuki Blog</title>
    <link>https://blog.keyuki.net/tags/%E3%83%9E%E3%83%AB%E3%83%81%E3%83%A2%E3%83%BC%E3%83%80%E3%83%AB/</link>
    <description>けゆきブログは、お金・IT・AI活用と暮らしの工夫を、実体験をもとに整理する個人ブログです。</description>
    <language>ja-JP</language>
    <atom:link href="https://blog.keyuki.net/tags/%E3%83%9E%E3%83%AB%E3%83%81%E3%83%A2%E3%83%BC%E3%83%80%E3%83%AB/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>GLM-5.3 は画像を読めない。Claude Code が画像入力で止まった話</title>
      <link>https://blog.keyuki.net/posts/ollama-cloud-claude-code-vision-error/</link>
      <pubDate>Sat, 05 Sep 2026 16:50:00 &#43;0900</pubDate>
      <guid>https://blog.keyuki.net/posts/ollama-cloud-claude-code-vision-error/</guid>
      <description>&lt;p&gt;先日、Ollama 経由で動かしていた Claude Code のセッションが、エラーで丸ごと止まりました。&lt;/p&gt;
&lt;p&gt;作業の途中で、AI が画像ファイルを開いた瞬間です。&lt;/p&gt;
&lt;p&gt;それまで普通にコードを読んだりファイルを編集したりしていたのに、画像を扱った途端にエラー。そのセッションでは作業を続けられなくなりました。&lt;/p&gt;
&lt;p&gt;原因を調べてみると、かなり単純でした。&lt;/p&gt;
&lt;p&gt;普段使っていた &lt;code&gt;glm-5.3:cloud&lt;/code&gt; は、そもそも画像入力に対応していませんでした。&lt;/p&gt;
&lt;p&gt;そしてさらに情けないことに、この仕様は実際にテストしなくても、Ollama の公式サイトを見れば分かります。&lt;/p&gt;
&lt;h2 id=&#34;claude-code-では画像も普通に扱える&#34;&gt;Claude Code では画像も普通に扱える&lt;/h2&gt;
&lt;p&gt;私は&lt;a href=&#34;https://blog.keyuki.net/posts/claude-code-ollama-cc-wrapper/&#34;&gt;以前の記事&lt;/a&gt;で書いたように、Claude Code を Ollama 経由で使っています。&lt;/p&gt;
&lt;p&gt;モデルは&lt;a href=&#34;https://blog.keyuki.net/posts/ollama-new-pricing-legacy-pro/&#34;&gt;料金の記事&lt;/a&gt;でも触れた &lt;code&gt;glm-5.3:cloud&lt;/code&gt; が中心です。&lt;/p&gt;
&lt;p&gt;Claude Code の便利なところは、AI が自分でファイルを調べたり、コマンドを実行したりできることです。&lt;/p&gt;
&lt;p&gt;「このフォルダを調べて」と言えば中を見てくれるし、コードだけでなくスクリーンショットなどを材料にして作業することもあります。&lt;/p&gt;
&lt;p&gt;Anthropic の Claude をそのまま使っている感覚だと、&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;画像ファイルがあれば、当然 AI が見られるだろう&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;と思ってしまいます。&lt;/p&gt;
&lt;p&gt;ところが、Claude Code の画面が同じでも、裏側で動いているモデルの能力は別です。&lt;/p&gt;
&lt;p&gt;今回、そこを完全に見落としていました。&lt;/p&gt;
&lt;h2 id=&#34;画像入力が失敗した原因は-glm-53&#34;&gt;画像入力が失敗した原因は GLM-5.3&lt;/h2&gt;
&lt;p&gt;最初は、&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Claude Code → Ollama の接続部分が画像をうまく渡せていないのでは？&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;と疑いました。&lt;/p&gt;
&lt;p&gt;そこで画像を含むリクエストを直接送るなどして確認しました。&lt;/p&gt;
&lt;p&gt;結果として、画像入力が失敗した原因はもっと単純でした。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;glm-5.3:cloud&lt;/code&gt; 自体がテキストモデルだったからです。&lt;/p&gt;
&lt;p&gt;&lt;a href=&#34;https://ollama.com/library/glm-5.3&#34;&gt;Ollama の公式ページ&lt;/a&gt;を見ると、&lt;code&gt;glm-5.3:cloud&lt;/code&gt; には「Text」と表示されています。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://images.keyuki.net/uploads/2026/09/ollama-cloud-claude-code-vision-error-glm53-text.webp&#34; alt=&#34;Ollama 公式ページで glm-5.3:cloud の Input が Text と表示されている&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Ollama 公式サイトの &lt;code&gt;glm-5.3:cloud&lt;/code&gt; モデル欄。Input は「Text」と表示されている（2026年9月5日時点）。&lt;/em&gt;&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
