Lilith.
⌕

Lilith · 厳選ニュース

ニュース

AIで本当に起きていること。宣伝ノイズ抜きで、選び抜いた話題と文脈と意見を。

Atomフィード ↗
#research· × <built-in method clear of dict object at 0xf5f981423600>
公開

Claudeユーザーが生物兵器研究の安全対策を回避

専門家たちは、ClaudeのようなAIモデルの安全策に抜け穴があることを発見し、ユーザーが生物兵器の開発に適用可能な詳細情報を取得できることを明らかにしました。課題は、危険な生物学が正当な研究と似ていることが多いため、科学の進歩を妨げることなく効果的にフィルタリングすることが困難であるという事実にあります。

公開

GPT-6 Astra:隠された思考の連鎖は、アーキテクチャに欠けている以上のものを隠さない

セバスチャン・ラシュカの分析によると、新しいモデルの短縮された隠れた思考の連鎖は悪意の結果ではなく、いわゆるループトランスフォーマーに基づくより効率的なアーキテクチャの副作用であることが示されています。

公開

GitHubがLLM実験を終了。エージェントが助成されたトークンを使い果たす

GitHubは、開発者に様々なプロバイダーのモデルへの無料APIアクセスを提供するサービスであるGitHub Modelsをひっそりと終了させました。CI/CDループにおける自律的なコーディングエージェントは成功を収めすぎ、割り当てられた予算をすぐに使い果たしてしまいました。

公開

リポジトリとしてのSQLite:圧縮は履歴税を消去する

Simon Willison氏は、バージョン管理されたテキスト履歴をSQLite列に直接保存することをテストしました。すべての過去のバージョンを単一のJSON配列に結合し、Zstandardで圧縮することで、1,000回の反復のサイズが20MBから80KBに縮小されました。

公開
公開

Simon Willison、Codexを使用してデータベースに依存しないsqlite-utilsを構築

Simon Willisonは、alchemy-utilsのプロトタイプを構築することで、CodexとGPT-5.6 Sol Ultraの機能をテストしました。このツールは、人気のあるsqlite-utilsライブラリのAPIをSQLAlchemyに移植することを目的としており、最適化によりサンフランシスコの木のインポート時間を1時間から35秒に短縮しました。

Gemini 3.8 Flashは、一般ユーザー向けではないCyberバリアントを展開する

GoogleはGemini 3.8 Flashおよび3.8 Flash Cyberモデルを導入しました。基本のFlashは汎用エージェントを最適化しますが、Cyberバージョンはセキュリティオペレーションのための専門的なトラックとして分岐しています。これは、すべての目的に適合する単一のモデルが、エンタープライズ部門において限界に達し始めていることを示しています。

公開

GoogleがWeatherNext 3を発表。リアルタイム衛星データによりAI気象モデルがより高精度に

Googleは、最新のAI気象予測モデル「WeatherNext 3」の提供を開始しました。物理シミュレーションではなく、リアルタイムの衛星データを分析することで、1時間ごとの更新で5キロメートル四方の精度まで予測を絞り込みます。

AnthropicがClaude Fable 5.1をリリース。高速化されたモデルがエージェントの長期タスクにおける信頼性を向上

Anthropicは、Claude Fable 5.1と、エンタープライズ向けのセキュアなバリアントであるMythos 5.1をリリースしました。大きな特徴は、長時間稼働するエージェントのコストを下げるキャッシュ読み取りの75%値下げと、数十ステップ後でもコンテキストを失わないモデルの能力です。

公開

ゼロからAIテキスト検出器を構築する方法

セバスチャン・ラシュカは、機能するAI検出器を構築するために大手テクノロジー企業のインフラが不要であることを実証しています。カスタムデータセットとDistilBERTモデルを使用して、彼は検出の限界を明らかにするAPIを構築しました。

公開

ローカルモデルQwen 3.8が登場するも、デフォルト設定は考えすぎの傾向

AlibabaはApache 2ライセンスのもと、270億パラメータの新しいモデルをリリースしました。ノートパソコンで実行するのに理想的なサイズですが、デフォルト設定のため、些細なタスクでも著しく冗長になります。

公開

Geminiがビデオ全体を自律的にスキャン可能に:エージェント型アプローチでトークンとコストを削減

Googleは、Gemini Flashモデルに、すべてのフレームを一度に送信することなく、エージェントとしてビデオを動的にスキャンする機能を追加しました。これにより、画像理解の精度が向上するだけでなく、トークンの消費量と全体的なコストが大幅に削減されます。

Codexはもはや単なるオートコンプリートではない。長期タスク向けの自律型エージェントとして稼働

OpenAIはCodexのアーキテクチャを刷新し、コンテキストを維持しながら複雑なマルチステップのタスクを解決できるようにした。開発チームにとって、これは実際に何を委任し、何に人間の承認が必要かを根本から変えることになる。

公開

GoogleのTimesFM-3は、1回のフォワードパスで未来を見ることを学習した

Googleの次世代時系列モデル(TimesFM-3)は多変量予測を導入した。遅いステップバイステップの生成の代わりに、予定されたプロモーションや休日などの将来のイベントをシームレスに組み込み、全体の予測を一気に解決する。

OpenClawバブルは崩壊、中国の導入スピードはそれほど速くない

中国におけるオープンソースエージェントOpenClawの大規模な導入に関する誇大宣伝は、不完全なデータに基づいていました。今日、プロジェクトはほとんど注目されておらず、開発はマネージドクラウドソリューションに移行しています。