{"as_of":"2026-08-10T05:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd56e03bf2ee8a3b4a8069621b2c7082d0aeee71485363f732dbffdffe8fd018","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:40:44.295476Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03204/citation-record","integrity":"/paper/2608.03204/integrity","json":"/paper/2608.03204/citation-record.json","paper":"/paper/2608.03204"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-05T23:40:43.954965Z","title":"Hewett, Mojan Javaheripi, Piero Kauff- mann, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.954965Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:878d0c738b48eccc820eef83e81b72b506a9511aa89840caa150dc8ac878e239","observation_id":"7c16032d-172d-479d-834f-dda25b0ef219","resolution":{"observed_at":"2026-08-05T23:40:43.954965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T23:40:43.964542Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.964542Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:77738b6a3b85800e5e07cb0efe881fcf3839a84a1fb1e81c1189246ac6d9b04b","observation_id":"ffe2048c-a7ef-40ee-8940-b68e544e7463","resolution":{"observed_at":"2026-08-05T23:40:43.964542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T23:40:43.971794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.971794Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:eea8b57908c7b58c407e039c9551852f581396c1e2096548d4edecc174162991","observation_id":"91e5c02a-1d6c-4e3e-ad6d-72de76bb161a","resolution":{"observed_at":"2026-08-05T23:40:43.971794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17084","last_updated":"2026-06-18T20:30:39Z","snapshot_observed_at":"2026-07-06T19:57:01.568072Z","submitted_at":"2024-11-26T03:48:22Z","title":"Upper and lower bounds on the subgeometric convergence of adaptive Markov chain Monte Carlo","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17084","snapshot_observed_at":"2026-08-05T23:40:43.979789Z","title":"Rosenthal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.979789Z"},"links":{"cited_paper":"/paper/2411.17084","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:0a9f7670ca1db774c7593064aa85bcae9b933d372d6ef170b77b463f5d20b058","observation_id":"834591df-be4a-4f61-b6d3-41c24eea1019","resolution":{"observed_at":"2026-08-05T23:40:43.979789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.863458Z","title":null,"venue":null,"work_id":"b7687b0d-9eac-4578-97c1-9e5202f9ca95","year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.987538Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:fca3bef40e7324fd5721a9b144df78e8ef22917415ae2f584cff354aceca8091","observation_id":"d914a20b-4ccd-4f29-a243-9149b267e670","resolution":{"observed_at":"2026-08-05T23:40:45.868031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T23:40:43.998539Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:43.998539Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:8463c2973c7fd0f9b89833388fc0fe48f21dd928c0753c83bbbcdbcef084acda","observation_id":"3908201f-595c-48cb-89b7-1addb019ed60","resolution":{"observed_at":"2026-08-05T23:40:43.998539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T23:40:44.023655Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.023655Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:6fcb384cac79be7977ebb2cf9dc2513b75aec0ad903ba8188e8f16660bd5bc85","observation_id":"c80240b8-f4ef-42cc-a78e-3bd5ff3f27df","resolution":{"observed_at":"2026-08-05T23:40:44.023655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.034413Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.034413Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:b53c860ed0b1c789638a321c2087d453f58d47e3d42315958efa3bb2778dfd54","observation_id":"918a36cb-6ce6-4e30-9c1a-45cbb39b9797","resolution":{"observed_at":"2026-08-05T23:40:44.034413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.834673Z","title":null,"venue":null,"work_id":"4e5c392a-59b5-4727-baa7-8f7650d6090a","year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.053992Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:7db6ac5b868a3a5dcdce3521fbe43b3b8f8a37ddae231c7f5a0eb9a53e137245","observation_id":"1086171f-cdeb-4afc-9f7b-15227b3a79b5","resolution":{"observed_at":"2026-08-05T23:40:45.839439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.37556","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.401833Z","title":null,"venue":null,"work_id":"557366e1-7dd5-4333-b578-21d1626a33d6","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.060944Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:e26a61ffd8597dff3d93c52192c413b2feaa72c5a305f72d4b0751167d5ac2ee","observation_id":"5b2d3d94-7638-4018-8056-49a0a7e2ee92","resolution":{"observed_at":"2026-08-05T23:40:45.412143Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T23:40:44.068693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.068693Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:02fc20c5c3654c24dda3669977f6786c86d4655f5f83837ff6f638be3e2e5374","observation_id":"d6af3ff2-4482-4073-bfd6-3d346c529453","resolution":{"observed_at":"2026-08-05T23:40:44.068693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.817097Z","title":null,"venue":null,"work_id":"5d979f96-1783-4b52-b4b7-cc1539a6ce44","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.078728Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:2ae0dbbd94f887726603e5bfbdfd5de412b7e657282e065fc06464753b1e940a","observation_id":"81b6e140-6c7e-4562-bdee-6d95fe4b8353","resolution":{"observed_at":"2026-08-05T23:40:45.822094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26219","last_updated":"2026-06-03T00:59:51Z","snapshot_observed_at":"2026-08-04T07:23:55.106713Z","submitted_at":"2025-10-30T07:52:14Z","title":"Test-time reward-guided alignment of language models by importance sampling on pre-logit space","version":3},"cited_work":{"arxiv_id":"2510.26219","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26219","snapshot_observed_at":"2026-08-05T23:40:45.264797Z","title":"Test-time reward-guided alignment of language models by importance sampling on pre-logit space","venue":"cs.LG","work_id":"862dfcb6-fe61-4eac-b1f8-222607751710","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.083914Z"},"links":{"cited_paper":"/paper/2510.26219","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:65cd269748df227f2225fc0df276f3236f93dce14cfe91c073d1f7cf828adbfe","observation_id":"ee838593-103d-4b73-9a46-322fef941093","resolution":{"observed_at":"2026-08-05T23:40:45.272944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T23:40:44.091812Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.091812Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:9cb99817d08ca8d5914161d1d78bfabbc931740c41942d40a32b5b5743e90a89","observation_id":"07c03f6c-1e5d-4bf0-b4e7-abde8186707e","resolution":{"observed_at":"2026-08-05T23:40:44.091812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.801797Z","title":null,"venue":null,"work_id":"21a3da98-3555-478a-8ee1-370f462ed10f","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.099067Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:5c466764b0f9c77fb277d8b253118b931519897571318bd5ca4b362308cd876e","observation_id":"206ad40e-ef76-4ce1-8e6e-18edc6cc2ada","resolution":{"observed_at":"2026-08-05T23:40:45.806170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.112110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.112110Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:4b55f8aa21b602445d418b07b1e5493b6c6114672b457e3b1d1b80cee05d77b0","observation_id":"a7e8cf04-ad91-4bd8-81ab-68dea6b83507","resolution":{"observed_at":"2026-08-05T23:40:44.112110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12063","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.030426Z","title":null,"venue":null,"work_id":"ed0d0518-d436-4b6c-8af4-c71d3f1ff511","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.119062Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:932fd03625cbeab4b64ee789feaaf82b51437a1b8e578402015b2133aafa701a","observation_id":"19c0ef73-1159-460f-b4b6-c4e387c355ac","resolution":{"observed_at":"2026-08-05T23:40:45.045619Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.125184Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.125184Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:a32a1e458da53f058b72f78b87e354885b1ab9960b9352f6408a2884fddb712c","observation_id":"811c5da5-755d-40e6-b6bc-ffe64a336344","resolution":{"observed_at":"2026-08-05T23:40:44.125184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.774630Z","title":null,"venue":null,"work_id":"3b19ba7d-7f25-424d-81d7-783383240cdd","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.138501Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:7dac6c438ca0460f739e11eb4f856b53707f6131ad9fa5c665ef26c003c1795e","observation_id":"09fb523d-e986-4549-ad49-9a53b9f43e37","resolution":{"observed_at":"2026-08-05T23:40:45.779214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-05T23:40:44.131394Z","title":"arXiv:2508.19652 [cs.CV] https://arxiv.org/abs/2508.19652","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.131394Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:288563c5f85ee6cc08741c99a2656d77dac3e351f530eb945293a86ca1f466e8","observation_id":"4f5cf02d-ff9c-4ccb-98f0-7f52b5baf3d5","resolution":{"observed_at":"2026-08-05T23:40:44.131394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.153732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.153732Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:5529be440c201288bebfbb8e497363191e189ca366614a3c33bd0e5d17659410","observation_id":"7c8743f6-d70b-4555-b6e2-023318e305c8","resolution":{"observed_at":"2026-08-05T23:40:44.153732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.757983Z","title":null,"venue":null,"work_id":"86a6a1e8-a5f5-49b0-b3b9-259f1e898f0d","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.143096Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:0dcef87dca838722256436c6a976d93883608493c1765f53949e2a1304ff313b","observation_id":"4376d6b7-d3c1-43f0-9a23-8cdd8f9927d3","resolution":{"observed_at":"2026-08-05T23:40:45.762854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T23:40:44.173676Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.173676Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:d1ef193ebde40f95929bb245b75246725d34ff847368b732f1972853f6881041","observation_id":"ed553b15-d1b0-4495-8c8f-ea96c365a2e7","resolution":{"observed_at":"2026-08-05T23:40:44.173676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11271","last_updated":"2026-04-13T23:08:01Z","snapshot_observed_at":"2026-08-03T02:43:16.180683Z","submitted_at":"2025-02-16T21:18:47Z","title":"OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11271","snapshot_observed_at":"2026-08-05T23:40:44.158157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.158157Z"},"links":{"cited_paper":"/paper/2502.11271","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:9366b074fd2cc7779994b406429abae1a98431389d3d55dd6c1b09c648bc2f8d","observation_id":"03417896-7bcf-431b-b508-056e1759f143","resolution":{"observed_at":"2026-08-05T23:40:44.158157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.195837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.195837Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:6eb20168543ba47583e43911a0e0dc4f72360eb595a94e8149be832760358daf","observation_id":"b4def0f7-0b5a-4926-8b9c-9fbe5c0136f1","resolution":{"observed_at":"2026-08-05T23:40:44.195837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.728704Z","title":"Rosenbluth, Marshall N","venue":null,"work_id":"53820eac-631d-41cf-ac9e-540ef2bd9fb7","year":1953},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.183176Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:54ce829de271e6bc5fd5c4a3fadb6bec2d9c16e9332aedd5dd3bb8e08d8dbfd4","observation_id":"67dad757-6907-49ec-8c8e-3250fe472fce","resolution":{"observed_at":"2026-08-05T23:40:45.733175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.686282Z","title":null,"venue":null,"work_id":"8d28f374-ef12-4b2a-aae3-173787aa00a4","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.209851Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:a9d9abe5e0fce139d84f63ef40f4a6ac21df938223ed64d9998a7b78eb2b8def","observation_id":"1ce3ba9a-6177-4ef2-8d82-0a221be2d380","resolution":{"observed_at":"2026-08-05T23:40:45.694079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.708390Z","title":null,"venue":null,"work_id":"4c16d910-a02c-4298-a499-5f8df58058c1","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.203823Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:a57a4622d5ae018389fbc015e71e81cd9d95f97d97b67ca6e647f4dede4f9560","observation_id":"527a9f9f-112b-4c60-8de6-a1e7de4bb01a","resolution":{"observed_at":"2026-08-05T23:40:45.716683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.223039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.223039Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:6b6213b4e0bd14220b8f84fc5a53736ff095efe0f14c4c58a9266397fc7b2c95","observation_id":"ade2b30d-2545-481d-9209-2eceace83698","resolution":{"observed_at":"2026-08-05T23:40:44.223039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.666228Z","title":null,"venue":null,"work_id":"b7a15426-e193-4aca-b40c-164acc3d3975","year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.216531Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:105f6b6556553831f8542a557e1ac0d8ba0cfd6189ddd4e949e1085b2e1b10e1","observation_id":"e292575f-4fda-42a4-952c-ba0d70af968a","resolution":{"observed_at":"2026-08-05T23:40:45.671511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.232260Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.232260Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:1d3940f0c38390c27bb8ef8111ae2930ffd56020b429cddbf418e8515babc283","observation_id":"79f44172-1fc5-4b8b-bda3-337163c6c9bf","resolution":{"observed_at":"2026-08-05T23:40:44.232260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-05T23:40:44.227213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.227213Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:13ee00ce4ce526a3ab62261a403c197c26ed240a1ebb7e9fd199052ee14eac4d","observation_id":"b90d450a-95dd-4a70-accb-41ccb8724fa9","resolution":{"observed_at":"2026-08-05T23:40:44.227213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.649324Z","title":null,"venue":null,"work_id":"55c8ec71-f885-4ee1-bdd4-fa730e580392","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.245250Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:3060c8625b7c4f20a3cac7c63d2ed984a601cacadd9f728d4a6bcb9fe3f754d1","observation_id":"04bd8e14-79f2-48b0-ae60-912ed279eece","resolution":{"observed_at":"2026-08-05T23:40:45.654453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08193","last_updated":"2025-07-15T00:32:25Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:58:24Z","title":"GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08193","snapshot_observed_at":"2026-08-05T23:40:44.240475Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.240475Z"},"links":{"cited_paper":"/paper/2410.08193","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:ae13a6d64e76c84267bdc33354bad10d13f30e18aed6ec6154bc9686e839a456","observation_id":"4fefa55d-22c4-41d3-947e-649ac10207e5","resolution":{"observed_at":"2026-08-05T23:40:44.240475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.261857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.261857Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:2b3cfb05bd5632fdc16d87509975f9fb2029cf677f1499d538d3140612d6d3e4","observation_id":"34b6b973-ebf5-470b-94da-a5874671ad4a","resolution":{"observed_at":"2026-08-05T23:40:44.261857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.631434Z","title":null,"venue":null,"work_id":"37501356-9aa0-4d7f-9616-40ba8f5e3909","year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.250568Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:1e833a060f5afdc1d240e87bb0b1f04e25fe652f75d6e6fd585799e8ab697c0f","observation_id":"a7f77bf1-5157-40bd-9be4-09e9290b1e7b","resolution":{"observed_at":"2026-08-05T23:40:45.636537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.613363Z","title":"InThe Thirty-ninth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":"2ccfc060-89ff-47df-ad35-e7abb35a7b0e","year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.256735Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:32e4ce42af76cf9c1fa495b0501259633997638ec30c2590c32334e86edfc6ae","observation_id":"764b767d-969c-410f-8cf3-5d4ed3aafb61","resolution":{"observed_at":"2026-08-05T23:40:45.618323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-05T23:40:44.274871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.274871Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:f69565f788a25cdd03ad1e0bb1b5d509c91e32f258c0bd791a34e3840feed9b9","observation_id":"d76a7ce7-2c89-455f-84cf-5656ee435c68","resolution":{"observed_at":"2026-08-05T23:40:44.274871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.266410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.266410Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:0f83de46e90fd8789d01ead8a8d26bc8440a5c9f718205e4d2334b0c64a5b2ae","observation_id":"85f1ba01-233f-4439-a309-ce6d3d718d43","resolution":{"observed_at":"2026-08-05T23:40:44.266410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.597559Z","title":null,"venue":null,"work_id":"ed0496d4-182a-4eb2-a9be-abe34790ade1","year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.270701Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:05495ace0e049eba957756cc157db00e8e2aa5274d088d143ca2008cd15dbc77","observation_id":"10cf9f9f-c828-49bf-9eb6-3270dbb0e60c","resolution":{"observed_at":"2026-08-05T23:40:45.602369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T23:40:44.295476Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.295476Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:ddd4f754dd84f51523e9f0d33e7096efb08675265e9db26cb269b7b88f6a24e8","observation_id":"83759865-2f9f-46c3-93d1-37eb8a27137f","resolution":{"observed_at":"2026-08-05T23:40:44.295476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.580257Z","title":null,"venue":null,"work_id":"9d0dad65-f96d-4795-accc-f4a0c561c232","year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.280638Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:77f14b83024bfad9ed06f0d0264defc0489a3ebd076d692d90eeba1320bb3075","observation_id":"66a9da88-4205-470e-8ac6-2944b179d2cc","resolution":{"observed_at":"2026-08-05T23:40:45.584966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:45.559177Z","title":null,"venue":null,"work_id":"cda0b1f5-1353-4c03-9cfa-2abe5f4fc831","year":2024},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.290806Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:cacaab9e92c6b8bb1205e469ea6f0a20fc7144ee277f5bab99f366d83901c4f3","observation_id":"d78e814c-c15c-4f81-b0a6-38c2ac5b09af","resolution":{"observed_at":"2026-08-05T23:40:45.566303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:40:44.285616Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":1662,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.285616Z"},"links":{"citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:85bd987972666e7629f79816f90db2a6ba904d49ba7965c6f93b09206290bfe1","observation_id":"bd8fa0a2-c76f-4093-83e4-7f365bb2d9eb","resolution":{"observed_at":"2026-08-05T23:40:44.285616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T23:40:44.046346Z","title":"arXiv:2503.17352 [cs.CV] https://arxiv.org/abs/2503.17352","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:44.046346Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2608.03204"},"observation_digest":"sha256:5f1c61553216dd9f2b030aecb03f1fc4d7a3eaaa4c9be91bdc2ce87c6bf819f6","observation_id":"b0817614-de8b-4077-8b79-ca8026882d94","resolution":{"observed_at":"2026-08-05T23:40:44.046346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03204","last_updated":"2026-08-04T06:47:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T06:29:33.276922Z","submitted_at":"2026-08-04T06:47:08Z","title":"Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.03204."}