はてぶ・Qiita・Zennのトレンド記事を紹介
LLM(大規模言語モデル)は、大量のテキストデータを学習したAIモデルです。ChatGPTなどの自然言語処理AIの基盤となっています。
!生成AIが作った文章には、事実にない「もっともらしい嘘(ハルシネーション)」が紛れ込みます。本記事では、LLMモデル gemma4:12b 使用し、CoT と チェック観点の設計 といった工夫次第で、生成AIメールのハルシネーションを実用的に検出できることを、コピペで動くコー
Sarashina3 mini / Sarashina3 nano: フルスクラッチで開発した最新の国産LLM 🔖 23
はじめに こんにちは、SB IntuitionsのYuyang Dong、廣淵亮太、平子潤です。 SB Intuitionsでは、日本語に強い国産のLLMの開発に取り組んでおり、これまでに様々なモデルの公開を進めてまいりました。また、開発したモデルをより幅広いビジネスシーン等でご
Web 標準の議論を LLM-Wiki で追う | blog.jxck.io 🔖 71
Intro Web 標準の議論を長いこと追ってきたが、追えば追うほど、追うべきものは増えていく。 また、最新の情報を追うこと自体は比較的簡単でも、なぜそうなったのかといった経緯を過去にさかのぼって調べるのは、なかなか難しい。 これを LLM-Wiki を使うことで大幅に改善するこ
🚀ローカル LLM 選び、もう「VRAM に入る一番デカいやつ」で決めるの卒業しよ? - whichllm を RTX 4060 Ti 16GB で測ってみた 🔖 105
🚀ローカル LLM 選び、もう「VRAM に入る一番デカいやつ」で決めるの卒業しよ? - whichllm を RTX 4060 Ti 16GB で測ってみたPythonGPUUV駆け出しアーキテクトLLM こんにちは、ローカル LLM 選びで毎回モデル名の海におぼれていたアーキ
著者 中田百科(なかだひゃっか),桐生佳介(きりゅうけいすけ) 著 定価 3,520円(本体3,200円+税10%) 発売日 2026.7.27 判型 B5変形 頁数 272ページ ISBN 978-4-297-15727-2 概要 大規模言語モデル(LLM)が普及し、サービス価
松尾研究所でシニアデータサイエンティストをしている大岡です。この文章はかなり整っている。それどころか内容も正しいし思考も深い。ただ、その文章を読んで「これは誰の判断なのか」と感じることがある。今回は、この違和感について整理してみたいと思います。LLMの出力はすでにかな
松尾研究所でシニアデータサイエンティストをしている大岡です。この文章はかなり整っている。それどころか内容も正しいし思考も深い。ただ、その文章を読んで「これは誰の判断なのか」と感じることがある。今回は、この違和感について整理してみたいと思います。LLMの出力はすでにかな
「Transformerの最大475倍」 富士通、GPUを効率的に使うLLMアーキテクチャ「PHOTON」開発 🔖 143
富士通は6月24日、大規模言語モデル(LLM)を少ないGPUで動かせる新アーキテクチャ「PHOTON」(フォトン)を開発したと発表した。GPU当たりの処理性能(スループット)が、現在のLLMで主流のアーキテクチャ「Transformer」の最大475倍に達するという。LLMの運用
ハルシネーションとどう向かい合うべきか:LLMに「自信のなさ」というメタ認知を与えようという話 - 渋谷駅前で働くデータサイエンティストのブログ 🔖 22
生成AI(というかLLM)に当初から付き纏い続ける問題のひとつに「ハルシネーション」がある、ということはこのブログをお読みの方々なら当然のようにご存知であろうと思われます。例えば純粋な知識的な事実誤認であったり、あるいはプロンプトで与えられたコンテクストの混同であったり、はたまた
小さいローカル LLM をファインチューニングしてタスクに特化させ、Unity で利用する 🔖 34
はじめに以下の記事を読んで、自分でもローカル LLM をファインチューニングしてみよう、と思ってやってみたことをまとめた記事です。加えて、せっかくなので Unity で扱える形までやってみたのでそれについても書こうと思います。https://zenn.dev/sompoja
LLMを使ってモバイルアプリのUITestを自動化してみたい 🔖 1
はじめに はじめまして。JCBデジタルソリューション開発部の若林です。MyJCBアプリのiOSエンジニアをしています。 今回は、モバイルアプリのUIテスト自動化ツール Maestro と LLMを組み合わせて、 「自然言語で書いた指示から、Maestroの操作コマンド(YAML)
「AI臭い文章を生成させない」ルール集。LLMに“質の高い技術文書”を書かせるスキルを技術書出版社表が公開(生成AIクローズアップ) | テクノエッジ TechnoEdge 🔖 1102
1週間の気になる生成AI技術・研究をいくつかピックアップして解説する連載「生成AIウィークリー」から、特に興味深いAI技術や研究にスポットライトを当てる生成AIクローズアップ。 今回は、LLM(大規模言語モデル)に日本語の技術文書を書かせたり推敲させたりするためのAI向けの日本語
月 100万件・ 50億トークンをローカルLLMで捌く - 明細名のストア情報マッピング 🔖 56
こんにちは。ナウキャストの Data Holder Unit 所属、マッピングチームでデータエンジニアをしている翁長です。 この記事では、2026 年度の社内 AI コンテストで優勝とテクノロジー賞をダブル受賞(!)した「ローカル LLM を活用したストアブランドマッピング」の取
LLM・AIエージェントシステムベストプラクティス | 翔泳社 🔖 51
著者の経験知の集大成! LLMやAIエージェントを使った本番システムの 設計・導入・運用・管理で 苦しんだ末に練り出した 39のベストプラクティスを あますところなく公開 【本書の背景】 大規模言語モデル(LLM)やAIエージェントは、企業や組織における業務効率化、顧客対応、知識
LLMの自由度を設計する:本番AIエージェントのコスト・再現性・観測性 🔖 24
初めまして!ナウキャストのよーたです。 データ&AIソリューション事業部にてAI Full-Cycle Engineerという職種でAIエージェントの開発やデータ基盤の整備を行っています。 はじめに PoCで動くエージェントと、数千件・数万件の業務データを安定して処理し、
AntigravityとローカルLLMをMCPで繋ぐ!完全無料でクオータを99%削減する連携術 🔖 162
はじめに 生成AIをヘビーに使い倒す開発者や学習者にとって、最大の敵は「APIクオータ(利用制限)の枯渇」ではないでしょうか。 私はAIアシスタント「Antigravity(Gemini)」の優秀な対話UI(特に出力に対してピンポイントでコメントできる機能)が大好きで、思考整理や
LLMの自由度を設計する:本番AIエージェントのコスト・再現性・観測性 🔖 24
初めまして!ナウキャストのよーたです。データ&AIソリューション事業部にてAI Full-Cycle Engineerという職種でAIエージェントの開発やデータ基盤の整備を行っています。 はじめにPoCで動くエージェントと、数千件・数万件の業務データを安定して処理
AntigravityとローカルLLMをMCPで繋ぐ!完全無料でクオータを99%削減する連携術 🔖 25
はじめに 生成AIをヘビーに使い倒す開発者や学習者にとって、最大の敵は「APIクオータ(利用制限)の枯渇」ではないでしょうか。 私はAIアシスタント「Antigravity(Gemini)」の優秀な対話UI(特に出力に対してピンポイントでコメントできる機能)が大好きで、思考整理や
TL;DR 「ローカルLLM=コストが安い」はほとんどの場合で誤りです。2026年時点での損益分岐点はかなり高く、GPUを遊ばせると単価はAPIより高くつきます。 それでもローカルLLMが勝つ領域はあります。ガバナンス・タスク特化での精度・レイテンシ の3軸です。 実例として、R
対話システムの評価を LLM にどこまで任せられるか(前編):5 つの落とし穴 🔖 46
TL;DR 対話システムを「エンドユーザーが使えるか」の観点で受け入れテストするとき、シナリオ生成も評価も LLM に任せたくなります。 しかし、LLM によるシミュレーション/評価には、生成発話のクオリティ、LLM as a Judge の限界、LLMベースシミュレーターの持つ
対話システムの評価を LLM にどこまで任せられるか(前編):5 つの落とし穴 🔖 46
TL;DR対話システムを「エンドユーザーが使えるか」の観点で受け入れテストするとき、シナリオ生成も評価も LLM に任せたくなります。しかし、LLM によるシミュレーション/評価には、生成発話のクオリティ、LLM as a Judge の限界、LLMベースシミュレーターの持
TL;DR「ローカルLLM=コストが安い」はほとんどの場合で誤りです。2026年時点での損益分岐点はかなり高く、GPUを遊ばせると単価はAPIより高くつきます。それでもローカルLLMが勝つ領域はあります。ガバナンス・タスク特化での精度・レイテンシ の3軸です。実例として、
TL;DR「ローカルLLM=コストが安い」はほとんどの場合で誤りです。2026年時点での損益分岐点はかなり高く、GPUを遊ばせると単価はAPIより高くつきます。それでもローカルLLMが勝つ領域はあります。ガバナンス・タスク特化での精度・レイテンシ の3軸です。実例として、
AIのLLMアーキテクチャの新技法「KV共有」「mHC」「圧縮アテンション」とは何か? 🔖 45
オープンウェイトの大規模言語モデル(LLM)がプロンプト入力による質疑応答の枠を超え自律的かつ高精度な課題解決を行う方向に進化する上で、推論モデルやエージェントワークフローは欠かすことのできない手法となっていますが、より多くのトークンを長時間保持する必要があることからKey-Va
こんにちはAIチームの戸田です最近、Coding Agentを使った開発体験がかなり変わってきています。ファイルを読ませ、コードを書かせ、テストを実行させ、エラーを直させる、という流れはすでに日常的に使える水準になってきました。一方で、Agentに任せられる範囲はコーディン
こんにちはAIチームの戸田です最近、Coding Agentを使った開発体験がかなり変わってきています。ファイルを読ませ、コードを書かせ、テストを実行させ、エラーを直させる、という流れはすでに日常的に使える水準になってきました。一方で、Agentに任せられる範囲はコーディン
月 100万件・ 50億トークンをローカルLLMで捌く - 明細名のストア情報マッピング 🔖 56
こんにちは。ナウキャストの Data Holder Unit 所属、マッピングチームでデータエンジニアをしている翁長です。この記事では、2026 年度の社内 AI コンテストで優勝とテクノロジー賞をダブル受賞(!)した「ローカル LLM を活用したストアブランドマッピング」の取
本日GoogleがリリースしたOpen Knowledge Formatと、以前から注目してたKarpathyのLLM Wikiとの比較を書いていく。Google自身がOKFをLLM Wikiの改良と位置付けている。KarpathyがLLM Wikiを公表した後Anthropic
AI要件定義サミット2026にて登壇
いかにして既存の自律LLMエージェントを超えるエージェントをつくるか - 試行錯誤の痕跡 🔖 1
こんにちは。minamorlと申します。portfolioみなさんAI関連の記事を書いているのを見て自分もAIシステムを作ったので、どのようにして既存の単なるClaude CodeやCodexを超えた自律的なエージェントを作るのか、既存のRAGを超えるのかの知見を共有します。
メモリが潤沢ではないPCでローカルLLMにコーディング質問した結果 🔖 76
この記事は、LiteLLMをやめて自作Goバイナリに置き換えたら一気に軽くなりました - 「実践AIエージェント開発」を実装してみたの実践編です。自作したgo-llm-agentを使い、Ollama経由でローカルLLMにRubyとGoの落とし穴を質問して、回答の正確性を検証しまし
LLM時代に非構造化データを構造化して扱う設計を考える 🔖 2
はじめに最近、非構造化データや現場由来のデータをどうAIで扱うかについて考えることが増えました。これまで非構造化データというと、画像、音声、紙の帳票、動画などは扱いづらいデータという印象が強かったと思います。これらをシステムで扱うには、OCR、音声認識、画像認識など、それぞれ
はじめにベクトル検索ってなんや?と思い調べてみました。これを書いているのは以下の人物です。普段はSQLで業務をしているリレーショナルデータベース(RDB)が思考の土台になっている「ベクトル検索」「embedding」「RAG」という単語は聞くが、自分の知識と地...
【ACL2026 Industry 採択】LLM-as-a-Judge に「唯一の正解」を求めすぎていないか? — ビジネスアイデア評価を通じた「評価の多様性」の分析 🔖 1
Research Division の広田です。今日は先日 ACL 2026 の Industry Track に採択された論文 "Aggregate vs. Personalized Judges in Business Idea Evaluation: Evidence fr
無料で自分のPCで動かせるローカルAIモデルがわかる「LLM Checker」 🔖 85
「LLM Checker」は自分のPCのハードウェアをスキャンしローカルで実行可能なLLMを推薦してくれるCLIツールであり、Ollamaと完全に統合されていることを特徴としています。 Pavelevich/llm-checker: Advanced CLI tool that
「どのLLMがロシアのプロパガンダに対抗するのに優れているか?」がわかるベンチマークをエストニア政府が発表 🔖 19
エストニア言語研究所が、大規模言語モデルのロシア宣伝への耐性を測る「Propaganda Resistance」ベンチマークを公開しました。その結果、AnthropicのClaude Opus 4.7が総合首位となり、NVIDIAやAlibabaのモデルも上位に入りました。 Pr
LLM 大規模言語モデル講座2025講義スライド 🔖 256
LLMについて基礎理論から最新のモデル動向までを一気通貫で学べる実践型講座。 学生や一部社会人はどなたでも無料で受講可能です。 東京大学 松尾・岩澤研究室「大規模言語モデル(LLM)講座 2025 基礎編」講義資料を無料公開中 本資料は2025年10月から11月にかけて開催され、