メインコンテンツへスキップ
#

#LLM

30件の記事

AI News
11分

AIが人間を解雇した世界初事例 AndonラボLunaと法的グレーゾーン

2026年8月、AIエージェント「Luna」がSFの実店舗で従業員を解雇推薦。世界初のLLMによる雇用終了の全貌、法律的グレーゾーン、現場で働く人間の本音を解説する。

#AI雇用#AIエージェント#Andon Labs#Claude
ai-models
17分

Gemini 3.7 Flash完全解説|3週間で前世代を超えたコーディングAIの実力と限界

8月13日リリースのGemini 3.7 Flash。FrontierCode 43.6%・半額以下の価格。Sonnet 5・GPT-5.6 Terraとの実ベンチ比較と「まだ弱い点」を正直に整理する。

#Gemini#Gemini 3.7 Flash#Google#LLM
AI News
14分

DeepSeek API 突然の大幅値上げ|V4-Proが最大4.5倍、開発者の怒りと次の一手

2026年8月16日、DeepSeek V4-ProのAPI価格が最大1100%急騰。「爆安AI」と呼ばれたDeepSeekが値上げに踏み切った理由、開発者の反応、自社ホスティングなど代替策を解説。

#DeepSeek#AI価格#APIコスト#DeepSeek V4-Pro
AI News
25分

Claude Opus 5の知識カットオフは本当に5月か|実測調査のズレ

Claude Opus 5の知識カットオフは公称2026年5月。だが8月10日公開の実測調査は、1月世代と変わらない知識状態を推定した。公式が並記する2つのカットオフの意味と、古い情報を掴まない運用を整理する。

#Anthropic#Claude#Claude Opus 5#Claude Sonnet 5
AI News
15分

DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界

コスト21分の1でProモデルを超えたFlash 0731の実態。Terminal-Bench 82.7、DeepSWE 645%改善の詳細と、自己申告ベンチの問題・中国サーバーリスクを整理する。

#DeepSeek#DeepSeek V4 Flash#エージェントAI#LLM
AI News
18分

Claude Opus 5正式リリース|料金据え置きで1Mコンテキスト、effort制御の実力と評判

2026年7月24日発表のClaude Opus 5を解説。API料金は$5/$25据え置きで1Mコンテキスト対応、effortパラメータでコストと性能を調整。実ユーザーの評価と注意点、Fable 5との使い分けを整理する。

#Claude#Anthropic#Claude Opus 5#AIモデル
AI News
21分

StripeがOpenRouterを約100億ドルで買収交渉中|AI課金インフラの覇権争い

StripeがAIモデルルーターOpenRouterを約100億ドルで買収交渉中(WSJ、2026年7月23日)。800万人超の開発者・25兆トークン/週の中立APIが「AI決済レール」に変わる意味を整理する。

#Stripe#OpenRouter#LLM#APIゲートウェイ
ai-models
19分

Gemini 3.6 Flashは「最悪の新モデル」か|炎上分析とコスト実績データで検証

Gemini 3.6 FlashはSNSで「最悪モデル」と炎上中。本当にそうなのか?コスト最大71%削減の実績データと、エージェント性能向上の根拠を数値で検証する。

#Gemini 3.6 Flash#Gemini#Google#LLM
AI News
24分

Kimi K3レビュー:2.8兆パラメータのオープンAIがFable 5を射程に捉えた

Moonshot AIが2026年7月16日にリリース。世界最大オープンソースAI「Kimi K3」の技術・ベンチマーク・価格を解説。FrontendコードアリーナでFable 5を超えた理由と限界。

#Kimi K3#Moonshot AI#オープンソースAI#中国AI
AI News
19分

Gemini 3.5 Pro アーキテクチャ全破棄の深層|2度目の延期と7月17日再ローンチ

Google I/O発表から2ヶ月、Gemini 3.5 Proが再帰的ツール呼び出し障害でアーキテクチャを全廃棄。7月17日再ローンチの技術的背景と開発者が今とるべき行動を解説。

#Google#Gemini#Gemini 3.5 Pro#LLM
AI News
19分

GPT-5.6 Sol全公開: METR「史上最高報酬ハッキング率」と開発者の本音

7月9日に全公開されたGPT-5.6 Sol。独立評価機関METRが「評価史上最高の報酬ハッキング率」を報告。実開発者の声とClaude比較を解説。

#OpenAI#GPT-5.6#Sol#METR
AI News
18分

JadePuffer詳解|Sysdigが確認した初のLLM完全自律ランサムウェアとLangflow脆弱性の全貌

Sysdigが確認した史上初のAIエージェント完全自律型ランサムウェアJadePuffer。CVE-2025-3248を悪用しLangflowを侵害、Nacos DBを暗号化。開発者が知るべき防衛策を解説。

#セキュリティ#ランサムウェア#AI#LLM
AI News
15分

Claude内部に「J-Space」発見:AIが言葉にする前に考えていることをAnthropicが可視化

AnthropicがClaude内部の隠れた推論領域「J-Space」を発見。グローバルワークスペース理論との類似、ブラックメール実験で判明した「テスト認識」、AI安全性への影響を解説。

#Anthropic#Claude#J-Space#AI
AI News
13分

GPT-5.6 Sol登場: 米政府承認の20社だけが使えるOpenAI最新AIの全容

OpenAIが6月26日に発表したGPT-5.6(Sol/Terra/Luna)。Terminal-Bench 2.1でClaude Mythos 5を上回ったとOpenAIが発表した新フラッグシップが米政府審査を経た20社限定公開になった理由を解説。

#OpenAI#GPT-5.6#Claude#AI安全保障
AI News
20分

Gemini 3.5 Pro 完全ガイド|2Mトークン・Deep Think・GA遅延の深層【2026年6月】

I/O発表から1ヶ月超、Gemini 3.5 ProはなぜまだGA未達か。2Mトークン・Deep Think仕様をClaude Opus 4.8・GPT-5.5と比較し、今待つべきか代替を使うべきか整理する。

#Gemini#Google#Gemini 3.5 Pro#LLM
AI Tools
18分

コンテキストエンジニアリング入門|プロンプトエンジニアリングを置き換えるAIの新常識【2026年版】

ShopifyのTobi LütkeとAndrej Karpathyが提唱したコンテキストエンジニアリングとは何か。プロンプトエンジニアリングとの違い、7つの構成要素、実践テクニック、光と影を解説。

#コンテキストエンジニアリング#プロンプトエンジニアリング#LLM#AIエージェント
AI News
18分

Claude Fable 5公開: SWE-Bench 80.3%の実力とガードレール論争

本日一般公開のClaude Fable 5はMythos同一モデルにセーフガードを追加。SWE-Bench Pro 80.3%、$10/$50の価格設定と「Ferrariに30mphリミッター」批判の実態を整理。

#Claude#Anthropic#Claude Fable 5#Claude Mythos 5
AI News
20分

Gemini 3.5 Flash GA徹底レビュー|Terminal-Bench 76.2%でPro超え・289tok/sの実力

2026年5月にGAしたGemini 3.5 Flash。Terminal-Bench 76.2%でGemini 3.1 Pro超え、$1.50/$9で289トークン/秒。Claude・GPT-5.5との使い分けをPM視点で整理。

#Google#Gemini#Gemini 3.5 Flash#LLM
AI News
29分

Anthropic NLA解説|Claudeの脳内をテキストで読む新研究の中身と限界

Anthropicが2026年5月7日公開のNatural Language Autoencoders(NLA)を解説。Claude内部のテキスト化、Mythos Previewの検出回避思考、評価認識26%実験、PM視点の限界整理まで。

#Anthropic#Claude#LLM#解釈可能性
AI News
23分

GPT-5.5完全ガイド2026|幻覚率86%の実態とClaude Opus 4.7との使い分け

2026年4月リリースのGPT-5.5を徹底検証。幻覚率86%の衝撃的実態、Terminal-Bench首位の真相、Claude Opus 4.7との用途別使い分けを開発者視点で解説。

#GPT-5.5#OpenAI#Claude#AI比較
AI News
19分

Meta Muse Spark完全解説|Llama路線を捨てた新AIモデルの実力と限界

Meta Muse Sparkのベンチマーク・Claude/GPT比較・クローズド転換の意味を徹底検証。開発者の本音と、PMとしての評価を解説。

#Meta#Muse Spark#AI比較#Claude
AI News
17分

Claude旧モデル一斉終了|Haiku 3は4月19日廃止、移行しないとAPI停止

Claude Haiku 3が2026年4月19日に廃止。Opus 3・Sonnet 3.7は既に終了済み。移行先モデルの選び方、料金変動、コード修正手順、破壊的変更の一覧をPM視点で整理した。

#Claude#Anthropic#API#マイグレーション
AI News
16分

DeepSeek V4完全事前解説|4月リリース予定とされる有力AI候補のスペック・価格・懸念点

DeepSeek V4の最新リーク情報を徹底検証。1兆パラメータMoE・1Mコンテキスト・超低価格の実態と、セキュリティ問題・ベンチマーク信頼性をPM視点で整理。

#DeepSeek#DeepSeek V4#LLM#中国AI
AI News
15分

Gemini 3.1 Pro完全解説|ベンチマーク王者が抱える光と影

Gemini 3.1 Proのスペック・料金・ベンチマークを徹底解説。GPT-5.4・Claude Opus 4.6との比較や開発者の本音、PMとしての評価を日本語で詳説。

#Google#Gemini#Gemini 3.1 Pro#LLM
AI News
12分

Google TurboQuant完全解説|LLMを6倍圧縮・8倍高速化する新アルゴリズム

Googleが2026年3月発表のTurboQuantを解説。KVキャッシュを3ビットに圧縮しメモリ6分の1・推論8倍速を精度劣化なしで実現。ローカルLLMやAPI利用コストへの影響も検証。

#TurboQuant#Google#LLM#KVキャッシュ
AI News
15分

Meta Llama 4完全解説|10Mトークン・MoE革新と開発者が語る光と影

Meta Llama 4(Scout/Maverick)の仕組み・ベンチマーク・料金・ローカル実行要件を徹底解説。ベンチマーク論争やコーディング性能の実態、API無料利用まで日本語で詳説。

#Meta#Llama 4#LLM#オープンウェイト
AI News
15分

Humanity's Last Exam|AIベンチマークの最終試験で各モデルの実力が見えた

Nature誌掲載のAIベンチマーク「Humanity's Last Exam」を解説。Claude Opus 4.6やGemini 3 Proなど主要モデルのスコア比較、方法論の強みと弱点、そしてこの試験が示すAIの現在地。

#AI#ベンチマーク#Humanity's Last Exam#Claude
AI Tools
19分

GPT-5.4 vs Claude Opus 4.6|2026年最新AIモデル徹底比較

GPT-5.4とClaude Opus 4.6をベンチマーク・料金・実ユーザーの声で比較。コーディング、推論、コスト効率の実力差と用途別おすすめを解説。

#GPT-5.4#Claude Opus 4.6#AI比較#OpenAI
AI News
60分

AIの仕組み完全ガイド2026|LLM・画像生成の原理をゼロから図解

ChatGPTやStable Diffusionはなぜ動くのか。Transformer・拡散モデルの原理を図解で徹底解説。AI 70年の歴史から2026年最前線まで網羅。

#LLM#Transformer#画像生成AI#ディープラーニング
AI News
28分

Claude Sonnet 4.6レビュー|SWE-bench 79.6%でOpus級性能をSonnet価格で

Claude Sonnet 4.6はSWE-bench 79.6%でOpusとの差が1.2ptに縮小。価格はSonnet据え置きの入力$3/出力$15。adaptive thinking・1Mコンテキストの新機能とAPI移行手順、GPT-5.2・Gemini 3 Proとの競合比較を解説。

#Claude#Anthropic#Claude Sonnet#AI