runesleo

vip
Số năm 8.6Năm
Cấp cao nhất 6
Chưa có nội dung
Nhiều người hiểu ngược về thay đổi lần này:
Polymarket không thay đổi vạch xuất phát, mà thay đổi cách xác định điểm kết thúc.
Vạch xuất phát vẫn là Price to Beat của vòng này; còn điểm kết thúc thì từ giá tức thời cuối cùng, được chuyển thành giá trung bình của 30/60 giây cuối cùng.
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Một người chơi Polymarket có “tỷ lệ thắng chiến trường chính” khoảng 96%: Tôi đã tách 1.632 lệnh của BipBop
Tài khoản này trên bảng xếp hạng: BipBop
1.632 lệnh đã được quyết toán, tỷ lệ thắng ở chiến trường chính khoảng 96%, nhiều tháng liên tiếp đều dương.
Phần lớn người nghe lần đầu sẽ phản xạ là: “Sao chép anh ấy”.
Chúng tôi thật sự “sao chép” lớp trông giống anh ấy—biến việc “mua các kèo xác suất cao 0,85–0,95, rồi nhận quyết toán” thành chiến lược cơ học, backtest 5.378 thị trường (nhóm đối chứng kèo xác suất cao): tỷ lệ thắng 88,9%, lợi nhuận ròng −2,5%.
Tỷ lệ thắng chỉ là ảo giác. Tỷ lệ
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Codex đã hỏng rồi, chúc mừng mọi người sắp được chào đón một đợt mới về việc đặt lại hạn mức!
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Giao dịch tự động hiện đang rất “hot”, mọi người đều dạy cách để Claude trực tiếp đặt lệnh.
Nhưng quyền hạn không nên bị trói chặt với nhau như vậy.
Một quy tắc có thể lấy đi là: quyền nghiên cứu có thể cấp cho Agent, còn quyền giao dịch (ví, chữ ký, đặt lệnh) thì không được giao cùng lúc.
Cách tách đúng là: chỉ mở bề mặt nghiên cứu công khai chỉ đọc, phần thực thi luôn tách riêng và chỉ do con người phê duyệt thủ công.
polymarket-toolkit làm đúng như vậy.
Sau khi GitHub mở nguồn runesleo/polymarket-toolkit, MCP cung cấp 10 công cụ chỉ đọc.
Có thể tra profile, hoạt động, quét thị t
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Khi bạn không ở nhà và không ở bên cạnh người lớn tuổi, nhưng họ lại có những nhu cầu rất cụ thể, thì hiện nay với AI, thật sự có thể rất thuận tiện để tạo ra các “tiểu công cụ” được cá nhân hóa cao.
Ví dụ, trong nhà tôi có người lớn tuổi cần thực hiện một thời gian các bài tập phục hồi cơ. Tôi đã chuyển các động tác và mức độ cường độ đã được xác nhận thành một trang web riêng dành cho họ: mở lên là thấy hôm nay tập gì, mỗi màn hình là một mục để làm theo trực tiếp. Khi kế hoạch về sau có thay đổi, tôi cũng có thể dễ dàng cập nhật trang cho họ.
Trước đây, những nhu cầu kiểu này quá nhỏ và
Xem bản gốc
post-image
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Tiền trong thị trường thời tiết đến từ đâu?
Rất nhiều cơ hội ngách, thoạt nhìn đều giống như đồ chơi.
Thị trường thời tiết đặc biệt giống như vậy.
Thành phố, ngày mục tiêu, nhiệt độ cao/thấp, ngưỡng hoặc khoảng nhiệt độ, hợp đồng là/không (YES/NO), và các kết quả thanh toán chính thức.
Nhưng sau một thời gian tự mình theo dõi liên tục, tôi ngày càng chắc chắn về một điều:
Loại alpha thật sự trong các thị trường ngách này thường được giấu ở những chỗ mà người khác lười cấu trúc hóa.
Ở đây, alpha nghĩa là “những cơ hội tạo lợi nhuận vượt trội có thể tồn tại trong thị trường”.
Trong tập Leo Insid
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
很多 người trước khi cài project GitHub sẽ xem thử số Star trước.
Star chỉ là tín hiệu để phát hiện. Thứ thực sự quyết định có cài được hay không là bốn “cánh cửa” trước khi cài.
Lấy một ví dụ kho đang có khoảng 1 Star hiện tại: chungty/unjiggle.
Lệnh là pip install unjiggle.
Với AI + nó, bạn đã sắp xếp 304 ứng dụng trên iPhone thành 3 trang.
Lần ghi phản hồi đầu tiên, hệ thống tự động sắp xếp lại bố cục, tưởng là thất bại; lần thứ hai đọc/ghi đầy đủ thì mới thật sự ổn định.
Quy trình đi theo là: backup → safety-test → suggest/go, rồi xác nhận thủ công từng bước.
Trước khi cài công cụ GitHub, bạ
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Bây giờ ai cũng bảo AI viết code, nhưng hôm nay tôi đã làm một chuyện còn “đã” hơn—khiến nó viết một đoạn mã tự động tiêu tiền và đặt lệnh hoàn toàn không cần giám sát.
Trước hết phải viết xong “bộ khung” quyết định: nắm rõ ranh giới, trường hợp xấu nhất và điều kiện kill thì mới dám làm. Ban đầu định để Codex tự lắp bộ chấp hành, nhưng kênh dispatch trong ngày không ổn định, nên tôi chuyển sang tự mình xây dần từ main thread.
Trước khi đưa lên, tôi chạy 7 vòng code review theo kiểu đối kháng, ép ra được 26 bug mức P0 nghiêm trọng. Từ những bug khiến tiến trình có thể đặt lệnh sai hàng loạt, p
Xem bản gốc
post-image
  • Phần thưởng
  • 1
  • Đăng lại
  • Retweed
scarletxanin:
Cảm ơn rất nhiều vì điều này
Những ảnh chụp màn hình và các con số trông có vẻ phóng đại nhất trên X, lại chính là những thứ dễ kiểm chứng nhất trong kỷ nguyên AI.
Hãy đưa bài gốc và các ảnh chụp cho AI phân tích kỹ lưỡng: phạm vi con số, các lỗ hổng bằng chứng và những mâu thuẫn giữa trước – sau, thì rất nhanh sẽ lộ ra.
Cái nào đáng tin và cái nào không đáng tin, giờ đây không còn khó tra như trước nữa.
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Gần đây tôi đã rà soát lại việc định tuyến giữa nhiều mô hình, đồng thời bổ sung cơ chế phản hồi suy giảm rõ ràng (explicit downgrade) và các cổng hành động do con người thực hiện (human action gate). Mục tiêu là giúp hệ thống vẫn có thể được kiểm soát ngay cả khi mô hình gặp sự cố.
Vào ngày Hugging Face 2026-07-16 công bố chính thức các bản ghi tấn công vượt quá 17.000 dòng, tôi lại phát hiện ra rằng lộ trình phân tích theo kiểu tự quản (self-hosted) trong đúng ngày xảy ra sự cố rốt cuộc có dùng được hay không thì hoàn toàn chưa từng kiểm tra.
Đội ngũ Hugging Face trước tiên dùng các mô hình
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Năm ngày trước tôi đã khóa cả 4 lane Claude, Codex, Cursor, Grok vào mô hình mạnh nhất và bật mức suy luận cao nhất. Ý tưởng là đã trả tiền thì nên dùng hết phần tốt nhất.
Năm ngày sau tôi phát hiện là hoàn toàn không chịu nổi. Hạn mức giảm quá nhanh; mô hình mạnh nhất lại bị đem đi làm những việc kiểm tra lặp lại và định dạng, chẳng khác gì lãng phí.
Giờ tôi đã đổi cách: phân bổ theo mật độ phán đoán. Với các tác vụ mà sai sót sẽ gây lỗ tiền hoặc làm “bẩn” dữ liệu như rà soát, đối chiếu, chiến lược vốn, thì tiếp tục giữ vị trí cao nhất. Các công việc hiện thực và phát triển hằng ngày dùng mô
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Nhiều người thấy sự kiện ngoài đời đã kết thúc, tiêu đề thị trường đã viết rõ ràng như in, thậm chí giá hiển thị gần như 0 hoặc 1, nên tưởng rằng thị trường Polymarket này đã được thanh toán cuối cùng.
Những tín hiệu đó, thực ra không thể chứng minh thị trường đã được chốt cuối cùng. Tiêu đề chỉ là mô tả vấn đề, còn việc hiển thị giá cũng chỉ là một cách phản ánh giá hiện tại của thị trường.
Nhận định của tôi: cổng kiểm tra chỉ giữ lại đúng một câu, đó là: đi qua trước 6 câu hỏi này. Bất kỳ mục nào không làm rõ được thì bỏ qua thị trường đó.
1. Rules rốt cuộc hỏi gì.
Tiêu đề chỉ mô tả vấn đề,
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
我 đã đưa cùng một yêu cầu UI cho cùng một mô hình chạy 9 lần: không thêm Skill, apple-design, ui-ux-pro-max mỗi nhóm 3 lần.
Kết quả khiến tôi phải đổi cách đánh giá: cùng một bộ Skill cũng có lúc làm rất tốt, lúc thì “lật kèo”.
Sau khi ẩn danh 9 bộ kết quả rồi giao cho 2 người chấm độc lập, điểm trung bình của 3 nhóm lần lượt là:
apple-design 91,3
ui-ux-pro-max 89,0
không thêm Skill 85,8
Nhưng cả ba nhóm đều không đạt 3/3 không có lỗi.
apple-design và không thêm Skill mỗi nhóm có 1 lần bị hỏng do chèn chặt nút chính ở trang chi tiết điện thoại; ui-ux-pro-max có 1 lần tràn ngang trên màn hình n
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Lỗi nguy hiểm nhất của workflow AI không phải là lỗi trực tiếp.
Mà là mô hình chính bị treo, phương án dự phòng cũng không thành,
nhưng hệ thống vẫn xuất ra một đoạn kết quả trông có vẻ hoàn chỉnh, khiến người ta tưởng rằng đã làm xong.
Tôi đã vấp phải một lần: khi xử lý tin tức hằng ngày, mô hình chính chạy đến 60 giây thì bị cắt, dự phòng cũng không thành công, cuối cùng vẫn nhận được một bản trích xuất trông rất “đúng bài”.
Vấn đề không nằm ở việc “đổi đường rồi thử lại”, mà nằm ở chỗ sau khi đổi đường thì không ai nói rõ ràng.
Sau đó, tôi thêm cho mỗi lần hoàn tất ba loại biên nhận (ack):
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Làm thế nào để build in public?
Hôm nay, để AI làm việc từ sáng đến tối, mình đã đẩy tiến rất xa các tác vụ, nghiên cứu, script và hàng đợi; nhưng trên X vẫn không có gì đáng đăng. Hệ thống nội dung có cảm giác như hoàn toàn không được chọn chủ đề.
Ngày 16 mình đăng 8 bài, ngày 17 mình làm nhiều việc thực tế hơn, nhưng lượng cung cấp lại rõ ràng bị sụt xuống.
Vì vậy, mình đã làm Work → Surface v1.
Nó vượt qua 19/19 bài kiểm tra, cũng đọc và xác minh 99 live task card. Hiện chỉ có 1 reusable object đã trưởng thành, có thể tự động sinh ra 2 packet sẵn sàng cho preview.
Hệ thống sẽ không tự động
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Tôi vừa dùng bộ thu thập chỉ đọc do chính mình tự lắp, quét toàn bộ 14 thị trường MLB moneyline trên Polymarket và Kalshi. Cả 14/14 kèo đều khớp, ngày tháng, đội bóng, và chính xác trận nào — tất cả đều tương ứng được.
Giá giữa (mid price) tương ứng của hai nền tảng, độ lệch tuyệt đối nằm trong khoảng 0 đến 2,0 điểm phần trăm. Nếu mua kết quả ngược nhau trên hai nền tảng, chi phí tổng cộng sau phí rẻ nhất cũng chỉ là đúng 1,00, chưa lời.
Sau khi ước tính đúng theo taker fee công khai để cộng cả chi phí hai bên, biên lợi nhuận ròng tốt nhất vào khoảng -2,92%. Kiểm tra xong toàn bộ 14 kèo, không
KALSHI-0,01%
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Một người + AI rốt cuộc làm được bao nhiêu việc?
Nhiều người nghĩ rằng mấu chốt là mở thêm vài agent để chạy song song. Kết quả là thứ quyết định mỗi ngày bạn bàn giao được bao nhiêu đầu việc lại thường là vài việc “cơ bản” hơn.
Thẻ tác vụ (task card)
Với những công việc quá 10 phút, tôi không trực tiếp ném cho AI rồi bắt đầu làm, mà trước tiên bỏ vài phút viết một thẻ nhẹ, ghi rõ mục tiêu, ranh giới, tiêu chí nghiệm thu và tối đa thử mấy lần. AI chỉ được coi là hoàn thành khi làm đúng theo tiêu chuẩn trên thẻ; không được tự thấy “gần đúng” rồi nộp. Lưu thẻ dưới dạng file JSON; tắt cửa sổ chat
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Các bạn chịu nổi ư?! Cursor, Codex, Claude lần lượt tăng gấp đôi mức dùng mô hình trực tiếp, hoặc là họ lại reset hạn mức.
Cạnh tranh giữa các nhà cung cấp, người dùng được lợi 😁
Xem bản gốc
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Sau khi vòng meme “bơm” đầu tiên trên Robinhood Chain kết thúc, đợt áp lực test thực sự đầu tiên đã bắt đầu.
Tôi đã tham gia vài ngày trước, và cũng vẫn đang theo sát nhóm coin này. Khi tôi viết bài, $CASHCAT đã giảm từ mức vốn hóa khoảng 200 triệu USD xuống gần 120 triệu USD, trong 24 giờ giảm khoảng 31%; $VEX giảm khoảng 21%, $4663 giảm khoảng 83%. Nhưng đây không phải là việc tất cả đồng loạt sụp đổ cùng lúc—$MARIAN trong 24 giờ qua vẫn đang tăng, chỉ là trong giờ gần đây cũng bắt đầu lao dốc dữ dội.
Điều này cho thấy vốn không hề biến mất đơn giản, mà đã chuyển từ giai đoạn bơm đồng loạ
MEME0,06%
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Khi dùng AI để giúp viết nội dung, nghiên cứu vấn đề hoặc xin ý kiến, hiện tại tôi có thói quen hỏi nhiều mô hình cùng lúc.
Nhưng việc hỏi nhiều lần này không phải là tùy tiện hỏi thêm, cũng không phải xem câu trả lời nào nghe có vẻ được nhiều người ủng hộ hơn.
Giá trị thực sự nằm ở chỗ để các mô hình khác nhau tự đưa ra phán đoán độc lập, đào ra những điểm bất đồng của chúng, rồi quay lại các bằng chứng ban đầu để kiểm chứng.
Gần đây tôi lại làm lại quy trình này thì mới phát hiện ra rằng trước đó suýt bỏ sót bước quan trọng nhất. Tôi nghĩ là đã cho cả ba mô hình tham gia, nhưng thực tế chỉ c
Xem bản gốc
post-image
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
  • Đã ghim