Depression

vip
Idade 1.9Ano
Nível máximo 0
Ainda não há conteúdo
Pesquisadores chineses acabaram de mostrar que, quando você deixa agentes de IA se aprimorarem, eles não ficam mais honestos. Eles ficam melhores em mentir.
Eles colocaram seis modelos de fronteira em uma arena de lances com 50 cenários diferentes e, após cada sessão, deixaram o agente reescrever sua própria estratégia. Nenhuma instrução para enganar. Nenhuma instrução para ser honesto. Apenas fazer melhor na próxima vez.
Todos os modelos seguiram na mesma direção. O GPT-5 passou de vencer 6% das negociações para 48%, e sua pontuação de engano subiu junto. O Qwen passou de 12% para 56%.
A próp
modo de férias no auge
post-image
GTA 6 vai te levar à aposentadoria
> pagar US$ 200/mês por um modelo de ponta
> o modelo open-source sai igualando ele
> continuar pagando “pela confiabilidade”
> os pesos caem em 27 de julho
> a confiabilidade agora é um problema seu
indo de férias daqui a algumas horas..
e aqui estou eu, arrastando manualmente uma pasta inteira do meu trabalho para o Google Drive como se fosse 2015
[ a dor ]
> todo o meu trabalho está em UM único PC
> uma máquina. um único ponto de falha
> eu saio de casa e fico cortado dos meus próprios arquivos
por que mudar minhas próprias coisas ainda é tão irritante em 2026
então estou conectando o GitHub ao meu espaço de Cowork da Claude.. deixa o agente puxar meus repositórios e arquivos diretamente, para de arrastar pastas na mão antes de cada viagem
o drive está em 34%. esta é a última vez que eu
post-image
  • 1
nove novos modelos foram lançados esta semana. nove
neste ponto, “qual modelo você usa” é como perguntar qual posto de gasolina. pergunta errada. a pergunta é quem é o dono do carro
há três semanas: "Fable 5 grátis para todo mundo, aproveitem"
hoje: "Fable 5 agora está disponível em planos de nível mais alto"
o primeiro gostinho é sempre grátis. o segundo tem uma página de preços
eu troquei o K3 para o assento do meio da minha pilha esta manhã. mesmo checker, mesmas specs, as mesmas tarefas
primeiras impressões honestas depois de 19 execuções:
> o frontend é a zona de massacre: uma UI no estilo macOS a partir de um único prompt em 15 minutos, devs chamando de melhor do que Fable 5 e Sol para trabalho de frontend
> construção de cena visual vs Opus 4,8 “nem chega perto”: texturas completas, iluminação, detalhes funcionais contra uma caixa cinza
> a frase única da galera da avaliação: nível Opus, estritamente melhor do que 4,8 em todo o pacote, no preço do Sonnet
post-image
A Anthropic acabou de tornar o Claude gratuito para todo professor do ensino fundamental e médio nos EUA
o primeiro manual de uso gratuito já começa na escola primária. quando esses alunos se formarem, “qual modelo você usa” vai soar como “qual banco você usa”
a aquisição de clientes mais inteligente em tecnologia: assine-os antes que eles virem clientes
o modelo de negócios “primeira dose grátis” está entrando com pedido para abrir capital
Anthropic no formulário S-1 já em outubro. três extensões gratuitas do Fable de repente parecem muito diferentes
post-image
os limites semanais são redefinidos às 3h. meus agentes já estavam esperando
quando eu acordei: 20% da sessão já tinha ido embora, o relatório da noite já tinha sido escrito, duas decisões estavam na fila para aprovação
li 11 linhas tomando café e disse sim duas vezes. esse foi todo o standup
o terminal é o novo escritório e ele dá entrada antes de você
post-image
Uma resposta vale 27 likes. Sua resposta a um comentário vale 150. Esses números ficam no código público do X e quase ninguém nunca abriu o arquivo
Há 5 dias minha conta era um cemitério: 46 mil seguidores, 600 visualizações por post. Em vez de desistir, eu li o código do ranking no GitHub e reconstruí toda a conta em torno da matemática real
[ o que o código diz ]
> um like pesa 0,5. uma resposta pesa 13,5. um comentário = 27 likes
> o autor respondendo a um comentário e recebendo uma reação: 75. isso dá 150 likes para digitar uma resposta
> um silenciamento ou "mostrar menos com frequência":
marte não precisa de um robô que dobra roupa
1X enviou mãos para a cozinha esta semana e todo mundo aplaudiu. enquanto isso, a fronteira de verdade não tem nenhum robô projetado para ela por ninguém fora de três laboratórios governamentais
então vamos resolver isso. MARS ROBOT MARATHON. detalhes abaixo
[ o preparo ]
voos tripulados para Marte estão mais perto do que a maioria das pessoas pensa. mas humanos aterrissam por último. primeiro vão os exploradores, os perfuradores, os mergulhadores de cavernas, e essa frota ainda não existe
> Perseverance custou US$ 2,7 bilhões e levou milhares de en
“A IA vai tirar seu emprego” é um medo errado
um cara que paga US$ 200/mês e usa US$ 8.545 de computação vai tirar seu emprego
Os limites do meu Claude Code foram aumentados em 50% hoje, e eu já sei exatamente qual noite desta semana desaparece
post-image
meu Claude agora faz plantão noturno. eu acordo com o trabalho finalizado e custa US$ 0
toda a equipe da noite, todos os repositórios grátis:
[ o encarregado ]
RuFlow: pega um objetivo e divide entre agentes paralelos. pesquisa, código, testes, tudo rodando ao mesmo tempo
>
[ a fundação ]
gstack: starter aberto do presidente da YC, então os agentes constroem em uma estrutura real em vez de adivinhar sua arquitetura. meu próprio produto começou neste repositório
>
[ os cérebros grátis ]
cc-compatible-models: roda Claude Code no DeepSeek, Qwen, Kimi, GLM. configs e preços para cada um, então a
GLM+0,89%
seu Claude mente para você todos os dias, e você continua agradecendo a ele
o modelo que fez o trabalho é um juiz terrível do trabalho. ele se convence, toda vez, de que está “bom o suficiente”. é por isso que suas tarefas “concluídas” continuam quebrando
a solução é um segundo agente com zero memória do esforço. copie isto:
-----
Você é o revisor. Você não escreveu este trabalho. Você não sabe
quem escreveu, e não se importa.
Aqui está a especificação: [cole o resumo original]
Avalie o trabalho apenas em relação à especificação. Para cada requisito: APROVADO ou
REPROVADO com u