{"as_of":"2026-08-04T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6142460b5877ee2c70041dfb2cd1f0ff01135ef6e4124f61cc6c863b30229ff","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:29:30.210574Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T17:16:00.499779Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T17:46:07.008703Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2602.02150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.02150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ECHO: Entropy-confidence hybrid optimization for test-time reinforcement learning","venue":null,"work_id":"8ba6f75e-3de2-47db-8215-0fcabce5e896","year":2026},"citing_paper":{"arxiv_id":"2605.05262","last_updated":"2026-05-06T06:17:48Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-05-06T06:17:48Z","title":"Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:00.499779Z"},"links":{"cited_paper":"/paper/2602.02150","citing_paper":"/paper/2605.05262"},"observation_digest":"sha256:85f7a1131d9c681ffa21130836dc4f025ae5447565640a89b0ea0ceeb7f51355","observation_id":"931ec558-fc4e-480d-909b-3cbad9cbb1ca","resolution":{"observed_at":"2026-05-28T03:04:45.398688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.02150/citation-record","integrity":"/paper/2602.02150/integrity","json":"/paper/2602.02150/citation-record.json","paper":"/paper/2602.02150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-03T05:29:27.148641Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.148641Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:86046f89ccbe0a061486096c783e743c4ebccca778534ccc32832e8c89a17de9","observation_id":"ba16eefc-7a59-4215-85c1-4d67443a9cae","resolution":{"observed_at":"2026-08-03T05:29:27.148641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-02T03:10:09.020351Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-03T05:29:27.508814Z","title":"Deep think with confidence.arXiv preprint arXiv:2508.15260,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.508814Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:24b94e9c6897466b1be11aaa04cd2b8554ba39d1e2f3a54515c8edf23479b170","observation_id":"bbcb182c-7dc5-4836-a25d-eb073cf5cd7c","resolution":{"observed_at":"2026-08-03T05:29:27.508814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T05:29:27.641247Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.641247Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:59996085b2a25d679e24baeb78f638b9f5f87442acd21854ac3631a653b5e0ca","observation_id":"f61ba3da-5e8d-4a0f-8c4f-55b8647b43e0","resolution":{"observed_at":"2026-08-03T05:29:27.641247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-03T05:29:28.040915Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.040915Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:85af6f76c1a59b6f9a920180ab141c9fe9c20c0a04464eed3808ddd95c0527ef","observation_id":"f8ccd421-5d78-4159-8c09-acdcfc0cf531","resolution":{"observed_at":"2026-08-03T05:29:28.040915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-03T05:29:28.159222Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.159222Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:8b4320ffd129dcc1a6b8a7c7d9acd50dc6e5a11c01771caf9766d25f5f4e8906","observation_id":"6bd47e3f-aed5-468e-9987-8a42d82fd06c","resolution":{"observed_at":"2026-08-03T05:29:28.159222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.259075Z","title":"Tree search for llm agent reinforcement learning.arXiv preprint arXiv:2509.21240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.259075Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:3403d98bb15f5cb4ff8bab5a156096fe9001795ff1de6086674d0b4e91e28657","observation_id":"1c513edd-9ded-498c-82f1-fb149569d5f3","resolution":{"observed_at":"2026-08-03T05:29:28.259075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T05:29:28.440217Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.440217Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:2014ba364b3482c3121753502ab62beb2a8addabaeaed9df257bdf27e369e69c","observation_id":"534fd71e-c0aa-46e9-b074-44b0c6f12329","resolution":{"observed_at":"2026-08-03T05:29:28.440217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-02T16:49:32.082324Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11356","snapshot_observed_at":"2026-08-03T05:29:28.575603Z","title":"Ettrl: Balancing exploration and exploitation in llm test-time reinforcement learning via entropy mechanism.arXiv preprint arXiv:2508.11356,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.575603Z"},"links":{"cited_paper":"/paper/2508.11356","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:89359980e23340affe1537bcd6af8d514ec9d90f6a30a6783b63e81521d3c4b4","observation_id":"3f38d4cf-570a-4a5a-a3c5-9710540765b5","resolution":{"observed_at":"2026-08-03T05:29:28.575603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T05:29:28.665263Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.665263Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:adf73dab8edcb889eeaf5c96c5cdc439f821e37974489422dcdc89b58b048206","observation_id":"4a7e2142-1ce1-41da-823f-11d16319bdfc","resolution":{"observed_at":"2026-08-03T05:29:28.665263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-03T05:29:28.713259Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.713259Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:f7db2ebd63450924d7dbba53cda814cc24040a32d704e9f6a03e6f7905512fd2","observation_id":"d828de3e-b917-465e-92b1-fb455682e8fd","resolution":{"observed_at":"2026-08-03T05:29:28.713259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T05:29:28.789056Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.789056Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:9f4a49662f7fcd1b8074eaddd366c43f1616ec49254a458f1cf9e538bafac023","observation_id":"56823190-2c6c-4186-b445-d26eaacfcf89","resolution":{"observed_at":"2026-08-03T05:29:28.789056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T05:29:29.019924Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.019924Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:ef24b37c3e3b627ac482b60cf8ec9fefb5af219a702f4f3249a2571ff57ad234","observation_id":"70d81845-3612-492c-aa86-26df9a139765","resolution":{"observed_at":"2026-08-03T05:29:29.019924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T05:29:29.085109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.085109Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:7e03522db0343fe49e5e51a277c7e0a00cd86d99062bd9187a06fedd3572fc79","observation_id":"98f0c4b1-5a95-40a5-905c-070074d88b6e","resolution":{"observed_at":"2026-08-03T05:29:29.085109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T05:29:29.292079Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.292079Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:f16f0d5c439a439adefe44d00da9a5fbfb1514fb502fa2402561ff0f11a15f6f","observation_id":"be0ddac4-b876-4917-a912-8282b807067f","resolution":{"observed_at":"2026-08-03T05:29:29.292079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T05:29:29.393951Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.393951Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:59eeae7fe9c921556e8ed8bec1207b9c7171a6fa443a70d5c862653e2b769b20","observation_id":"6515c923-53b5-4a8f-971c-50a0dc309ab1","resolution":{"observed_at":"2026-08-03T05:29:29.393951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-03T05:29:29.521368Z","title":"Learning to reason without external rewards.arXiv preprint arXiv:2505.19590, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.521368Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:d73f40a913342826db055f0b5b451514eee2f37fa16b38e9a20fcd71f2b714a6","observation_id":"767c0429-5729-4a53-80d7-008c6c71924e","resolution":{"observed_at":"2026-08-03T05:29:29.521368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.670391Z","title":"Evolving language models without labels: Majority drives selection, novelty promotes variation.arXiv preprint arXiv:2509.15194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.670391Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:24ee287b4f0ac33bf6462965897f1be9d7b25ee772a74d7dae20ae28070cbe58","observation_id":"5bbb9519-929b-45cd-aadb-749ab98959b3","resolution":{"observed_at":"2026-08-03T05:29:29.670391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-03T05:29:29.795255Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.795255Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:5f8bc20d200e243e706243c4cd8e47d5ec874ccdeabff6d974c464e7b9a21c2a","observation_id":"d1e7b6ed-41c7-4e17-9ee1-8df0b4d8bf23","resolution":{"observed_at":"2026-08-03T05:29:29.795255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.937356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.937356Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:f142fe64aebfe2db6ab2d9c124316106788c8a4076313fbc147b3e03a0f9b05c","observation_id":"e026cf04-701b-4003-829b-c6556f678359","resolution":{"observed_at":"2026-08-03T05:29:29.937356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.076673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.076673Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:3397fc01132055e45e6092b57b1a76546274f3e3144869b7348dee2ef1fa0b82","observation_id":"c298c9a4-1ef8-4d2f-a9ba-3318340809c1","resolution":{"observed_at":"2026-08-03T05:29:30.076673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.210574Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.210574Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:11294a67e72c5dfffa4a1e5ca382c3265bc0a2274aa9e155b71c9dc210ac7f84","observation_id":"14a74240-5b58-45d8-9724-7e83b61f1252","resolution":{"observed_at":"2026-08-03T05:29:30.210574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.349671Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.349671Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:36df9ab425ada587fff99fd21b1021dedbb98bf17181209054515ab064db4389","observation_id":"83e8a216-f516-40b9-8aad-a20078ad7f60","resolution":{"observed_at":"2026-08-03T05:29:28.349671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.211496Z","title":"Bapo: Stabilizing off-policy reinforcement learning for llms via balanced policy optimization with adaptive clipping.arXiv preprint arXiv:2510.18927,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.211496Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:e051e1c5546c6c80609ea2707f7f42a566aadb8cc8986622b6be595052215eb5","observation_id":"bf67b164-38b9-4af2-82bd-96ae7384a5f2","resolution":{"observed_at":"2026-08-03T05:29:29.211496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.878007Z","title":"Can large reasoning models self-train? arXiv preprint arXiv:2505.21444,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.878007Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:5fdc217e96508511784734299a15010097dd447d537c2b54a30d1f13e18ce5f6","observation_id":"5a4afd59-f7b6-4454-ba28-4157ea2649f4","resolution":{"observed_at":"2026-08-03T05:29:28.878007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.134691Z","title":"Unsupervised post-training for multi-modal llm reasoning via grpo.arXiv preprint arXiv:2505.22453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.134691Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:babcea72d79aa0685c2d896be100636f6576488ec26549713d9adac768f7a274","observation_id":"2d58a01f-0df4-4816-a91b-31e1f344a4c5","resolution":{"observed_at":"2026-08-03T05:29:29.134691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-07-06T21:41:52.859699Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-08-03T05:29:27.901205Z","title":"Treerl: Llm reinforcement learning with on-policy tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.901205Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:7718c98d48aaf78d436b4fd9b368a7c4b416025e126ce4a9f0fe060a5e394d3d","observation_id":"223c20ca-91da-4c58-9739-b077b2209246","resolution":{"observed_at":"2026-08-03T05:29:27.901205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:29:27.189984Z","title":"Qwen3-vl technical report, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.189984Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:132a19a73b67960b313196b70318a75ca429e02a50ef99aee3f9e06039ffa9a5","observation_id":"da3fd933-8924-4d36-93e0-bd608cfddeef","resolution":{"observed_at":"2026-08-03T05:29:27.189984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-03T05:29:27.789496Z","title":"Measuring math- ematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.789496Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:9996604eb853584cf9dcd35f0a2516898ea0ec632a86302a5a0c359dda6277e7","observation_id":"aff2c1da-0680-408a-84bc-e783ab657f76","resolution":{"observed_at":"2026-08-03T05:29:27.789496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:27.329790Z","title":"Agentic entropy-balanced policy optimization.arXiv preprint arXiv:2510.14545,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.329790Z"},"links":{"citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:422b6e9a0db614e411286ef871d2cb09d6cd5c1ad81cc5cb20b9dc95c475fdc3","observation_id":"17abc89d-d09e-4d49-9dfa-6d433e03d239","resolution":{"observed_at":"2026-08-03T05:29:27.329790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2602.02150."}