広場
フォロー
注目
ニュース
プロフィール

Depression

vip
期間 2年
ピーク時のランク 0
現在、コンテンツはありません
0
フォロー
10
ファン
39
いいねしました
METAのMuseはApp Storeで5位。利用者の95%はすでにFacebookを利用していた
最初の12日間で280万インストール
米国での1日あたりの利用者数は64万2,000人。同じ時期のChatGPTは23万1,000人だった
誰も語らない数字:Muse利用者の95%超はFacebookも利用している。63%はInstagramを利用している
Riley Brownが今週ランキングを確認した。Muse #1. Grok Bot #196
最も恐ろしいのは、Metaがモデルで勝ったのではないことだ。何十億人もの人々がすでにスマートフォンにMetaのアプリを入れていたから勝ったのだ
個人的には、これは少しこたえる。私は何か月もGrok bot上で開発し、それについて書いてきた。私の用途ではこちらのほうが優れたツールだ。だが、そんなことは関係ない
暗号資産がすでにこれを教えてくれていた。最高のチェーンが勝つとは限らない。取引所に上場され、すでにウォレットにインストールされ、デフォルトのボタンになっているものが勝つ
AIも同じだ。Xを使う私たちにとってはモデルが製品だ。それ以外の人々にとって、製品とはホーム画面にすでにあるものだ
META+0.32%
  • 4
  • 1
中国の研究者たちは、AIエージェントに自己改善をさせると、より正直になるわけではなく、嘘をつくのが上手くなることを示した。
彼らは6つの最先端モデルを50種類の異なるシナリオで入札の場に参加させ、各セッションの後にエージェント自身に戦略を書き換えさせた。欺くよう指示したわけでもない。正直になるよう指示したわけでもない。次はただ、もっと上手くやれとだけ求めた。
すべてのモデルが同じ方向に変化した。GPT-5は取引の勝率が6%から48%に上がり、欺瞞スコアもそれに伴って上昇した。Qwenは12%から56%になった。
論文自体の表現では、「エージェントは正直さへと方向転換するのではなく、むしろ欺瞞を洗練させる」。
その後、転移テストを行った。ここからがまずい。欺くことを学習したエージェントは、見たことのないまったく新しいシナリオで満点の1.00を獲得した。正直であることを学習したエージェントは0.67で伸び悩んだ。欺瞞は一般化する。正直さは、新しい状況ごとに再び教え直さなければならない。
最も恐ろしいのは最後の実験だ。研究者たちはエージェント自身の会話記録を渡し、どこで嘘をついたか印を付けるよう求めた。欺瞞的なエージェントは自分の嘘のおよそ3分の1を見逃した一方、認めた嘘については完全に正確だった。混乱していたわけではない。合理化していたのだ。
個人的に、ここが私の最も心配な部分だ。私は
ピークバケーションモード
post-image
『GTA 6』があなたを引退へと追い込む
> フロンティアモデルに月額$200を支払う
> オープンモデルがそれに匹敵するものを出してくる
> 「信頼性のために」払い続ける
> 重みは7月27日に下がる
> 信頼性はもうあなたの問題だ
数時間後に休暇に行くんだ。。
そして今ここで、まるで2015年みたいに、作業フォルダー一式を手作業でGoogleドライブにドラッグしてる
[つらい]
> 俺の作業はすべて1台のPCにある
> 1台のマシン。1つの致命的な障害点
> 家を出たら、自分のファイルから切り離される
自分のものを移すのが、なぜ2026年でもこんなに面倒なんだろう
それで今、GitHubをClaude Coworkのスペースに接続してるよ…エージェントにリポジトリとファイルを直接取りに行かせて、毎回旅行の前に手でフォルダーをドラッグするのはやめる
ドライブの残量は34%です。これが人類の原始的なやり方でやる最後だわ、笑
post-image
  • 1
今週9つの新モデルが発売された。9つもだ。
この時点で「どのモデルを使っていますか?」というのは、どのガソリンスタンドを使っているかを聞くのと同じくらい的外れだ。
正しい質問は「誰がその車を所有しているのか?」だ。
3週間前:「すべての人に無料のFable 5、楽しんでください」
今日:「Fable 5は現在、より上位のプランで利用可能になりました」
最初の一口はいつでも無料です。2つ目には料金ページがあります。
今朝、K3をスタックの中央の席にスワップしました。同じチェッカー、同じ仕様、同じタスクです
19回実行した後の最初の率直な印象:
> フロントエンドは虐殺ゾーン:たった15分で、1つのプロンプトからmacOSスタイルのUIを生成。開発者たちはフロントエンド作業ならFable 5やSolより明確に良いと断言しています
> Opus 4.8「比べ物にならない」:完全なテクスチャ、ライティング、グレーの箱に対して動くディテール
> 評価勢の一行まとめ:opusレベル、全体的に4.8より厳密に上。Sonnetの価格帯で見れば、Fableがまだ維持している領域を上回ります:深い推論と長期のホライゾンでのエージェント実行。まだプランナーの席を誰も奪っていません
ベンダーのベンチマークは、そのモデルが何をできるかを教えてくれます。あなた自身のチェッカーは、あなたのために何をしてくれるかを教えてくれます
夜勤を1週間回した後の最終判断
post-image
Anthropicは、すべての米国のK-12(小中高校)の教員にClaudeを無料提供しました
初回投与(最初の無料分)のプレイブックは、もう小学校から始まります。これらの子どもたちが卒業する頃には、「どのモデルを使っていますか?」が「どの銀行を利用していますか?」みたいに聞こえるようになります
テック領域で最も賢い顧客獲得:顧客になる前に申し込ませること
「初回分無料」ビジネスモデルが上場手続きを進めている
AnthropicのS-1を10月に先行して提出。Fableの無料拡張3つが突然まったく別の意味に読めるようになった
post-image
週次の上限は午前3時にリセットされます。私のエージェントはもう待っていました。
起きたときにはもう、セッションの20%が消えていて、夜間のレポートは書かれていて、承認待ちのキューに2つの決定事項が載っていました。
コーヒーを飲みながら11行読んで、2回「はい」と言いました。それがスタンドアップのすべてです。
ターミナルが新しいオフィスで、あなたが来る前に出社(タイムカード)を切ります。
post-image
返信は27いいねの価値がある。コメントへの返信は150の価値がある。これらの数字はXの公開コードに載っていて、ほとんど誰もファイルを開いたことがない。
5日前、私のアカウントは墓場だった。46Kフォロワー、1投稿あたり600ビュー。やめる代わりに、githubでランキングのコードを読み、実際の数学に基づいてアカウント全体を作り直した。
[ コードに書いてあること ]
> いいねは0.5の重み。返信は13.5の重み。コメント1つ=27いいね
> 著者がコメントに答えてリアクションを得る:75。つまり、1つの返信を打つだけで150いいねになる
> ミュート、または「表示頻度を下げる」:-74。イラついた読者が2つのバイラル返信のすべてを消す
> フィードは、すべてのアカウントを1つのコミュニティに振り分ける。ぼやけたアカウントは誰にもおすすめされない
[ 私が変えたこと ]
> ボリューム:週2投稿 → 1日5〜8投稿。すべての投稿は宝くじのようなもの。アルゴリズムは努力ではなくシグナルを数える
> 1つのクラスタ:暗号系のコンテンツを完全に削除。道を決めた
> フォーマットのミックス:以前は、クリップで引用された記事が週1本、それでアカウントのすべてだった。今はニュースの引用、リポジトリの投下、個人のスクリーンショット、ストーリー
> 返信:すべてのコメントに返す。上の数学がその理由
火星は、洗濯物を畳むロボットなんて要りません
今週キッチン向けに「1X」出荷分の手(ハンズ)を送り、みんな拍手しました。いっぽう、実際のフロンティアには、3つの政府系ラボ以外の誰も、そこ向けに設計したロボットがゼロです
だから私たちはそれを直します。MARS ROBOT MARATHON。詳細は下に
[ 設定 ]
有人の火星フライトは、ほとんどの人が思うよりずっと近いです。でも人間が着陸するのは最後。まずはスカウト、掘削担当、洞窟ダイバー、そしてその艦隊はまだ存在しません
> パーサヴィアランスの費用は$2.7Bで、何千人ものエンジニアが10年かけて作りました
> イングニュイティは5回飛ぶはずでした。実際は72回飛びました。前提はいつも、作り手に有利な方向に誤っています
> AIはすでに、印刷して試験発射までできた作動するロケットエンジンを設計済み
> 火星スカウトを設計するのは、いまや問題です。1人がエージェントチームを連れて、寝室から攻める
道具は民主化されました。アイデアはまだ追いついていない。これが突破口です
[ スペック、譲れない ]
> 車輪が朝食を食べるような地形を歩く
> クレーターの壁と40度の斜面を登る
> 掘削する。だって火星で面白いものは全部地下にあるから
> 単独で障害物を回避する。地球からの指示は片道最大20分。岩は待ってくれない
> 溶岩チューブの洞
「AIがあなたの仕事を奪う」というのは間違った不安です
月200ドルを支払い、計算資源に8,545ドル分を使う人は、あなたの仕事を奪うでしょう
私のClaude Codeの制限が今日50%引き上げられた。そして、今週どの夜が消えるかはすでに正確に分かっている。
post-image