{"as_of":"2026-08-09T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e459b484f1d532fc385e42e7df96fdf79de46d95b5cc28777344e7faf2a847e","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:52:37.405393Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03545/citation-record","integrity":"/paper/2608.03545/integrity","json":"/paper/2608.03545/citation-record.json","paper":"/paper/2608.03545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.359295Z","title":null,"venue":null,"work_id":"889c5df3-1ed5-475b-bf26-5a97827b6725","year":1986},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.125672Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:97db3d19f6faf83265d60a3dd31ff8d37b3d53a0af8320572b768ce522d8f3db","observation_id":"9ed278b8-71eb-4459-9c40-e8e4f961a4ae","resolution":{"observed_at":"2026-08-08T00:52:38.363913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.345329Z","title":", year = 1983, title =","venue":null,"work_id":"2d8c242b-ea94-4cf3-8637-72f6dbd5683e","year":1983},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.131388Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:8b96c892dd6022141c259583ba641968a002c5721d3ea34755aa534b699d063b","observation_id":"35873716-33c1-4ee7-a5d7-687ed403528d","resolution":{"observed_at":"2026-08-08T00:52:38.349715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.331270Z","title":", year = 1984, title =","venue":null,"work_id":"8084104c-8514-4ded-9ff1-960dec2ec021","year":1984},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.138291Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:2a3bffdd9a545a1b3d5ca747e7e4eb366717f442fec1bf5ad98e0c998d4d5639","observation_id":"185ea821-dcd0-4fa2-a70b-1c8587f17197","resolution":{"observed_at":"2026-08-08T00:52:38.335520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.143686Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.143686Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:2ae1f0333c5cf9b4637da7d1f2ed86765b41f9e5a8792eb78f91ed4167a06c4e","observation_id":"b3d29bff-8b19-4eab-85af-8753c59bde22","resolution":{"observed_at":"2026-08-08T00:52:37.143686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.306677Z","title":", year = 1980, title =","venue":null,"work_id":"2aeb8b3a-d49d-4a4c-b01d-f92fd2aefea6","year":1980},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.149323Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9320424141d637db1ba6bbc000e57c60bd549bc7b34cbab0be1c430776809a19","observation_id":"3608bf1c-1911-4653-84ac-93be67822f81","resolution":{"observed_at":"2026-08-08T00:52:38.311285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.154451Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.154451Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:67e2a8fa8d18bb721cef6446ecafd8b410ff0dc42d196c6cd2841f7a9393635c","observation_id":"7fe45bb2-cba3-4838-b941-ae90ab071f1d","resolution":{"observed_at":"2026-08-08T00:52:37.154451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.292436Z","title":"and Rennels, Glenn R","venue":null,"work_id":"f9489b86-9b76-4d29-a182-0a48914760de","year":1983},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.160028Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:4d29fba397bc93684ccbc21ae3c4c02fab432a413f08777d960d754f6563c417","observation_id":"0ac35a06-d4bf-4e1d-9431-1f99db176d23","resolution":{"observed_at":"2026-08-08T00:52:38.296976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.277977Z","title":null,"venue":null,"work_id":"ede16c16-9e4a-4a59-bef4-dbf07117b79d","year":1986},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.164832Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:85c858c38569007f4a234fe97c80bdf5c015b67a79810c1db0ba04368fa92ee5","observation_id":"cfc2ccef-ffbd-4879-bdb2-229b356bac7a","resolution":{"observed_at":"2026-08-08T00:52:38.282460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.263627Z","title":", year = 1979, title =","venue":null,"work_id":"4f5e99a1-5a58-43f6-9071-0f5944b2538b","year":1979},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.169591Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:c62315053c7a725e4d1cb8b863e457a269f789877544bd8da221ee8c8b27b3b4","observation_id":"6f41fcd9-91d7-4a90-85ab-5a1651d6b9e8","resolution":{"observed_at":"2026-08-08T00:52:38.268248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.248926Z","title":", title =","venue":null,"work_id":"74dcb357-c618-4713-852a-578e7634beaa","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.174492Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:783004ee61bf90f2c6a2928e7bbc561156dfcfd58c2cf29a0ad1073783ff6c9f","observation_id":"8423e12b-d49c-4ca6-8743-803e28c5f2ff","resolution":{"observed_at":"2026-08-08T00:52:38.253850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.179241Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.179241Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d1fa9a262172cd234f4ade680d605cbeb06c53520a389e6081fd4355e281e839","observation_id":"fef0cc84-d6bb-489c-bc68-e029c50a9b71","resolution":{"observed_at":"2026-08-08T00:52:37.179241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.183822Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.183822Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:f14f70e12094ab55deb6f7f0733c544c2a669c970187dc0f6db667237a5f5152","observation_id":"f57f9d02-2e29-4399-a2a4-e07407b6d9df","resolution":{"observed_at":"2026-08-08T00:52:37.183822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.188675Z","title":"The Eleventh International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.188675Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:e8cf2fe528bd26bcea7eb4a873d914fe37e5bb22a73a2385f589795483fe8d96","observation_id":"7230285f-38ad-475e-9636-945b7b7b6387","resolution":{"observed_at":"2026-08-08T00:52:37.188675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.193820Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.193820Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:20f3774e9493ecba8e0cd93b089fc2adef357cd15a772724c856cad6fd23bb6b","observation_id":"a192e1c2-29e3-421f-ba77-5439c7648c1b","resolution":{"observed_at":"2026-08-08T00:52:37.193820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.198413Z","title":"TTRL: Test-Time Reinforcement Learning , url =","venue":null,"work_id":"f7742f3b-44d2-4cea-9471-907e72f7d0bb","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.199002Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:0928b3fda138b9a54e3be12c7eb29a18c1925caa3143df8f8b7740f56a298e41","observation_id":"28f925f4-298b-49af-bc80-cafc8694a046","resolution":{"observed_at":"2026-08-08T00:52:38.202867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.184261Z","title":"2026 , eprint =","venue":null,"work_id":"08144007-74d6-4dd7-b15f-bca5c0a5d60e","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.204174Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:517dbb95211dd8b4ab24066b5d77c7f41d49e73bdf09d727215352fd33d90776","observation_id":"7a9c20f4-41d6-4a78-8f6c-cc472feeaa1c","resolution":{"observed_at":"2026-08-08T00:52:38.188738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.170031Z","title":"2025 , eprint =","venue":null,"work_id":"3773c481-e0f1-4cb0-9310-dff25ca7c065","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.209028Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:8ab8f050556a06393e05d7476506dd36bc44acf330af8f26e94768640b606fb6","observation_id":"7f668440-b608-4435-8fa4-1ee9e9964a04","resolution":{"observed_at":"2026-08-08T00:52:38.174641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.155001Z","title":"2026 , eprint =","venue":null,"work_id":"1cd817ca-c42e-43ba-aa76-a4c9f2a8b4cc","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.214354Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d13fb3dbd4ae9a9dd710f01325740fe5e83791b97d423f206f0509d06b9d4788","observation_id":"a27ffac8-fbe4-4c6c-930f-d5d2e403c0b3","resolution":{"observed_at":"2026-08-08T00:52:38.159714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.139904Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages =","venue":null,"work_id":"357758e0-e456-46e6-95ba-ecb5ec03e551","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.218963Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:51cc2bb4d015be4241d0e778726f56467050787f5625590696e5c1e7ba20ae50","observation_id":"adbaa938-1bcf-47fc-8526-8307834ead2d","resolution":{"observed_at":"2026-08-08T00:52:38.144454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.126276Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"e7920ca5-b891-4a0e-9e49-9e6e8488b708","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.224796Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:b71923e423732fdade6c214e937b9c6ab482bd2f2a80322c8aa70b6b77bd78ff","observation_id":"20e4baa6-33a1-486a-bb8e-f7f86972d041","resolution":{"observed_at":"2026-08-08T00:52:38.130677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.112355Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"732575a4-cb4d-4f6a-a689-d201e18cd18f","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.229542Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:26e53e269de8ee28d6845abdb481b44c651d9e59a0b0d1cbac4ffd12aad6cbbc","observation_id":"79e68d40-b81d-499d-968b-c94afc4010e3","resolution":{"observed_at":"2026-08-08T00:52:38.116799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.098794Z","title":"2026 , eprint =","venue":null,"work_id":"9a542147-6c39-415f-b9e8-8617216fab6e","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.234366Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:fb92bcb4717b0b192b8f1230fed50ae03b6cff4148f5351ce1711c1b0ae12770","observation_id":"aad71683-7505-4632-bdae-ade1e461c9f4","resolution":{"observed_at":"2026-08-08T00:52:38.103194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.085261Z","title":"Forty-third International Conference on Machine Learning , year =","venue":null,"work_id":"50c40dc7-6ba1-4197-b92e-4771204bfb1b","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.239627Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:00e261860a5cb6a2346f6708c9cb7f32c57ae1e3a4b0a2bc7081bb28066020b7","observation_id":"1718470a-a437-4913-a8fe-0b4324b23d6a","resolution":{"observed_at":"2026-08-08T00:52:38.089662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.244689Z","title":"DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.244689Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:ad739cdec973ae1c8ae231abcc7cff4af1b2d443491935225e0a1b14a2ea0895","observation_id":"3c107409-0448-475b-91d3-245a5a6e1c69","resolution":{"observed_at":"2026-08-08T00:52:37.244689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.249652Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.249652Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d9e79d62f4e8e6aeaa146dd3ceadb9c7abcd5e4ce5eef86f07dc4d61c69e77f9","observation_id":"72850efe-d844-4d56-b9bf-396ea6340ca9","resolution":{"observed_at":"2026-08-08T00:52:37.249652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.254564Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.254564Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:fec93805f66b49ea7d1fd54ba5341c59443a601c79b213c02f8908edbc6640b1","observation_id":"7d739666-e02b-4c69-96ea-050634c320bc","resolution":{"observed_at":"2026-08-08T00:52:37.254564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.053269Z","title":"ACM Computing Surveys , volume =","venue":null,"work_id":"9901de7b-69c3-4dfa-8a81-15197471699d","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.259146Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:afe67dbdc6cb47be5767653c6b38cacfc08231cc8f8f5c9c97b6787ffcfd7c08","observation_id":"fb731896-e67e-4e71-bd9b-a1385c1ed121","resolution":{"observed_at":"2026-08-08T00:52:38.058301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.039210Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":"8c108e1b-c52c-49b8-86b1-7feea2bc427b","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.264159Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:8ad791b93a6c3fd8e61f23def363f842a7f45173e362d661b203bf83740d1522","observation_id":"a2328cc5-d3fb-41e8-bc74-bead1257befe","resolution":{"observed_at":"2026-08-08T00:52:38.043693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.025264Z","title":"2025 , eprint =","venue":null,"work_id":"c0c81bc0-d8d8-4396-82dd-3baea1b01307","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.268766Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3dd8a44b27b2f72c652aa793dd4aae0e6416eeafcf697dd2cdb1bf0cb0a9e7bd","observation_id":"b5eb781d-193a-4253-a3b9-c151273900a7","resolution":{"observed_at":"2026-08-08T00:52:38.029749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.010861Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"13c527a5-9e71-4ddc-8e35-e04fe14965f8","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.273663Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:21456b725ac7a39a2761612d0263d8c990eb3461e70ad90b8b83f6fd3f609df3","observation_id":"11539c81-0316-421a-b678-9166245911af","resolution":{"observed_at":"2026-08-08T00:52:38.015451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.995888Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization , url =","venue":null,"work_id":"14ef96f1-a7c8-41fd-9247-3656159527f5","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.278216Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:6180617f79811a537ebf324023555f8606069f028a3b36f46e6971be660e9fe4","observation_id":"f788e82d-6b0d-4c88-9236-6177cfd148ea","resolution":{"observed_at":"2026-08-08T00:52:38.000775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.980596Z","title":"2026 , eprint =","venue":null,"work_id":"a426858f-490b-48ab-8fda-353ee988daf7","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.282965Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:ad8b457cca14c8e8e763877c78bbbaa7a9d36e88a067c027f0a61e6bcff932e4","observation_id":"813a7dde-7224-4df4-b079-24cc74824a68","resolution":{"observed_at":"2026-08-08T00:52:37.985176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.965961Z","title":"2026 , eprint =","venue":null,"work_id":"b397f76a-f921-4e64-a71a-84cd65f86097","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.287476Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:cff25db7edd48f32a615f44b97b41d1aaa3fd27569669431be2e78a824d33af5","observation_id":"19522351-5d6b-4f5a-8ea7-4483c3b21224","resolution":{"observed_at":"2026-08-08T00:52:37.970491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.951107Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , number =","venue":null,"work_id":"d6e37fa1-401b-4037-86d1-ae2fa74f7e41","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.292516Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:f0be75e5c2e1a7afe489664b1d54b485d5d01c1d77482c730d88bc659ce223dc","observation_id":"d29273ac-bbb1-4f0f-a13b-caf93ea42e2f","resolution":{"observed_at":"2026-08-08T00:52:37.955910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.936133Z","title":"2026 , eprint =","venue":null,"work_id":"f543bb97-da2d-421a-8025-e985e02df9cc","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.297300Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:34a81909d40044f22d0d5ad16f62fac5b4d86b03aab8553c4954c78987e4cc6b","observation_id":"613632e7-a01d-4dda-a218-95bcc6f1caae","resolution":{"observed_at":"2026-08-08T00:52:37.940948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.921937Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"765443ef-e4c6-4547-9c76-fc2baff60a36","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.301938Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:0f711ec86ce04c9f9aa448184a43b0e2e9ae33daf7e083beeee29948f20fdb79","observation_id":"f8802d1c-dc37-4058-8c6c-ac8382597cb9","resolution":{"observed_at":"2026-08-08T00:52:37.926536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.306383Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.306383Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:697a19312774a063a7d1a924218321edc109f78c4c4fcc0f903a1eef5c33fa53","observation_id":"d9c7f3dc-d4a5-49c1-91cc-cad23708d9e2","resolution":{"observed_at":"2026-08-08T00:52:37.306383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.311151Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.311151Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:de63c5acf64fa0cd9718182e27aa4a2160e08bc37f4d0c5290ffd42078369c01","observation_id":"ae6db8fd-e887-4b58-822f-50e922298525","resolution":{"observed_at":"2026-08-08T00:52:37.311151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.889988Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"65fd2aa7-b3f2-4e97-a9d1-e0b8b36f59c7","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.315756Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:43d3f3d2f01da14ed5564af45a1cc4309e6942201a56b7a8ecf77f29dc58305b","observation_id":"6f09fccf-7350-4f5d-b300-9bb198b0639c","resolution":{"observed_at":"2026-08-08T00:52:37.894932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.876620Z","title":"2026 , eprint =","venue":null,"work_id":"ac9718f6-d8ea-4e86-a476-5d685ffe7488","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.320316Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:4378456413e3896f03cfca9504dbf36ac1f554bdfa49c295d657ec2d5b94d355","observation_id":"7b77432a-8fd5-407a-99e6-c7719486bfa8","resolution":{"observed_at":"2026-08-08T00:52:37.881012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.861797Z","title":"2024 , eprint =","venue":null,"work_id":"c111fa3d-e40b-419d-a1c7-12c9aa3b817d","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.324949Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:24dcf088565b45ff69f821438b799676a2161b51c6f636c42182b0c5b44629cc","observation_id":"685415de-be4c-495f-b9df-191984cf0c50","resolution":{"observed_at":"2026-08-08T00:52:37.866652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.847925Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"bcaa00e8-cbfc-412d-b1ac-a5411dd6a938","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.330636Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:090bd9fe91c45fd58b63fb33c112858ba7e707bb2461b5adf32258b696d1b2d6","observation_id":"c9123113-4c72-4338-bad5-3c1160a8ae38","resolution":{"observed_at":"2026-08-08T00:52:37.852473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.834259Z","title":"2026 , eprint =","venue":null,"work_id":"b650adb8-239b-479c-9bda-0ea4483c0726","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.335195Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:53cb6639a1ddbdf1563ab00f1ca0c8974f93dd60b000b21368ee352273087326","observation_id":"c83c0caf-7d57-436f-a0d7-282ad478b756","resolution":{"observed_at":"2026-08-08T00:52:37.838805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.820309Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example , url =","venue":null,"work_id":"b3639774-eccd-46a6-8388-db9b28919c36","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.340347Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:eba1fbd86142be594b1ac75d99d4fc7a363c2b7620376bf2110af8b578e4849d","observation_id":"206a6009-f473-414a-b89e-7b37689ea0f4","resolution":{"observed_at":"2026-08-08T00:52:37.824996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.806567Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning , url =","venue":null,"work_id":"70a45ab3-eb0e-45a7-85b4-2c5b4634d152","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.345104Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:6d391c527429ae3ff4474b6335e9be0cc2629e534e144bec36e0519450ffa6c6","observation_id":"b5cfdda8-f7b2-4197-a10b-5932bf58afdc","resolution":{"observed_at":"2026-08-08T00:52:37.811006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.792056Z","title":"2026 , eprint =","venue":null,"work_id":"4269c99e-b22a-472b-a41e-d5681eaca9a4","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.350015Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3fdeb9d80fb3627b701f30a4ffe586811fe44801c36e782667e4f5e639e0fd7f","observation_id":"9f72fd16-6654-4ccb-8c74-5f5c6a2c1814","resolution":{"observed_at":"2026-08-08T00:52:37.796660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.777147Z","title":"2025 , eprint =","venue":null,"work_id":"f5a329ea-03c6-4d83-acbb-c123964e0574","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.354797Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:143fc5573ef73722b7ad22626884d54770d79ed50eb42ac52fdff7c50ae04677","observation_id":"c4f1566f-16b2-421e-82dd-9063565dd468","resolution":{"observed_at":"2026-08-08T00:52:37.781622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.763195Z","title":"2024 , eprint =","venue":null,"work_id":"03f96a30-b6a5-4893-ab7d-74be34f3f391","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.359492Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:0cf89be640b11e7122bb91b983d6a4f28740c5735da98a5e4db5f32134371f08","observation_id":"4c46b567-af8e-4ca3-9634-9754c596e643","resolution":{"observed_at":"2026-08-08T00:52:37.767694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.749485Z","title":"2021 , eprint =","venue":null,"work_id":"2857f1d5-aad8-4f5b-ba0c-b3425c7968be","year":2021},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.363908Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:79354d8ed0d3f27b9524fd56cbfcf98e81771a4b76f2ced6f8ab49727cb5261c","observation_id":"1579bc71-7677-4a15-aa62-b16ae9304b4d","resolution":{"observed_at":"2026-08-08T00:52:37.753867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.735150Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":"6138e916-5da0-4f1c-b24f-4987d7e3043e","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.368739Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3d3211cd4b165c49bede7fca8b47342a1673319905650807bc0864ed848ec57c","observation_id":"19720dca-b1e2-48e0-9c2a-1b824bad68a0","resolution":{"observed_at":"2026-08-08T00:52:37.739927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.721041Z","title":"Hugging Face repository , volume =","venue":null,"work_id":"779432a8-d41e-462b-919b-8820d7235de7","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.373259Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:a0406dcc380067fce666a7812cc3805dc04949bcaa3884a263a92b897df9caa7","observation_id":"7e02f688-fc05-453e-81b9-93c2e71db1c8","resolution":{"observed_at":"2026-08-08T00:52:37.725796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.377789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.377789Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9cfd15eb9212e8ad8e8addd6b2cf6996a8817fc63b46124bdfee010afe2c024e","observation_id":"4988a4e9-2759-4038-844c-33085495760b","resolution":{"observed_at":"2026-08-08T00:52:37.377789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.696411Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages =","venue":null,"work_id":"75d5209a-38fc-4755-880f-1ab5f58b1a38","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.382398Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:cf47d2e86216c91561ec8fd0140e67fa993213dbf2bd16624ee47654c0121438","observation_id":"06de54c9-ba28-4e50-8f3b-0211714439d0","resolution":{"observed_at":"2026-08-08T00:52:37.701090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.681320Z","title":"2025 , eprint =","venue":null,"work_id":"4bef44d7-916c-4655-8884-32ec7d83cd40","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.387143Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:e7300c985e8cbe0a85ab449cf96c6c9571ee30885e766bc4dc8b62aa681bcf4a","observation_id":"cbb5181a-3311-4f3d-8d9e-152a201fe851","resolution":{"observed_at":"2026-08-08T00:52:37.686100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.391538Z","title":"The Hidden Link Between","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.391538Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:523c55161a8acfccf6ebbfaa22d1656c947af757e7d0ec7a566042c6d24aa9cb","observation_id":"88758300-b891-42c6-ac45-1711f3e6a1f0","resolution":{"observed_at":"2026-08-08T00:52:37.391538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.666938Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":"fcd12012-3164-4637-b5ee-3df519267ab4","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.395884Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:2ae822814fa5da6f5e54736ad0cee95aa5e4c9773b3f6306fb5ca896484bc344","observation_id":"306e9743-db19-4fe3-9559-470fa2c9c306","resolution":{"observed_at":"2026-08-08T00:52:37.671530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.648480Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"8424bdab-5f37-48e6-ad48-5d67685dcaf4","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.400464Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:7ae8447165eb46261ec60951fdbc9193921e71cec43263610e153c358a2a0c7a","observation_id":"35b06d4f-4564-49d9-83a5-ab510ec2c64d","resolution":{"observed_at":"2026-08-08T00:52:37.656364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-03T11:31:07.805515Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-08T00:52:37.405393Z","title":"arXiv preprint arXiv:2406.11191 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.405393Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:cd7387986e6bf58315194079e98898b8dd7fe34193815fb4f42ccf1d57ec7edc","observation_id":"7fe7ba90-5138-4f16-8f00-5575d2f34a96","resolution":{"observed_at":"2026-08-08T00:52:37.405393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.03545."}