{"as_of":"2026-08-20T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63f366bef8e7c021c6c7b1c19185605902452ac96a9065991f0ccc80e00f8deb","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T22:38:02.945576Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.18444/citation-record","integrity":"/paper/2603.18444/integrity","json":"/paper/2603.18444/citation-record.json","paper":"/paper/2603.18444"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-18T16:20:55.129945Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:f198b74dfd823fbb235358b64907a404be216f38bef4ffc24ef1d10e6dee71a8","observation_id":"ee13414a-61dc-4dc7-8021-5d2f7949d656","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Bridging zero-shot object navigation and foundation models through pixel-guided navigation skill,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:9c5b277e6b417ad0d073b4ce78e458616fb202e7300886c23e4aff9a66d737d7","observation_id":"bab5cdb9-12ab-4224-913b-44d72fe7cb78","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"V oila: Visual- observation-only imitation learning for autonomous navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:d746dfa5490c87984080140515ee5f17f9b83d0e994e5d2254ddf519bcb8684c","observation_id":"b88404a6-763b-4eed-8e85-21e4a1cc880e","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embed- dings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:4528f856071e87f3ffd9c418dd0d5a2226b191b5a310d0c9d40477644ea64897","observation_id":"58a525dd-6cc7-4ab9-a1b1-e3980464365a","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Zero-shot active visual search (zavis): Intelligent object search for robotic assistants,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:06e44d6be7500c57e1fc8d973fc8661a73d0036d6c88dd1b381917c0a0fcc9ee","observation_id":"714bca8c-96b0-49a3-a054-9c28dc97cfad","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Zero-shot object goal visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:ceb72b7ba6202903b7808c1609d7b41b8eeca19c8211f4d7dbd7067d595f8854","observation_id":"8d31a1de-b4a2-47d7-9873-0616e56f2d04","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Hierarchies of planning and reinforcement learning for robot navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:9a976ece12fa5707a26da91c39643edab85c233fbf34f5e553be604bc8153533","observation_id":"3c8d42a3-5f05-4a76-bfee-4d1884f8e15f","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Esc: Exploration with soft commonsense constraints for zero- shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:720c724069cb2eb35daac3a2f4ba245e739b4e0cd3bcbe8d67d2acc1f398831e","observation_id":"ab6858b9-e292-4437-a020-e20ccafd8cc0","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero-shot object navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:4ca3f38efb54b3d90b2625a94c45c8608193eb3044c8dc193bbd7a9ddc6dea1e","observation_id":"d577743e-939c-408b-9d4f-db2b5c29def5","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Vlfm: Vision- language frontier maps for zero-shot semantic navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:130a0eb88e052e08d2fea495bd46ad4f08a2db41bbbb03e7305df74b10f67abd","observation_id":"cdf9663e-e929-4c8d-849f-e69b0e9f0c6a","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"V oronav: voronoi-based zero-shot object navigation with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:15748558b155036e21418ce35162eba0614390e364081c10aab1667b6ed081c1","observation_id":"4c53bf7a-33c8-4c47-b896-a78f15fd179d","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16425","last_updated":"2025-03-26T07:26:43Z","snapshot_observed_at":"2026-08-17T18:17:39.292030Z","submitted_at":"2024-11-25T14:27:55Z","title":"TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16425","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Topv-nav: Unlocking the top-view spatial reasoning potential of mllm for zero-shot object navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2411.16425","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:ce1536947def45ab0c05e5bc3e2e813048d8de645b2275302d64631e16aa8894","observation_id":"35611784-b131-465b-9273-15d5173dfbb2","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Cows on pasture: Baselines and benchmarks for language-driven zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:672fd3c87cf49168ead0f4d242610e3f54fdd71258a00108af59f99c4ebb3ab7","observation_id":"d9b4a430-86be-40b7-83e2-0d1fa2aa0616","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Star-searcher: A complete and efficient aerial system for autonomous target search in complex unknown environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:ab498b4176788c4c3e44ea1560dbcee1ff5b07f73f2bc26bf64b0de91430e76f","observation_id":"55c31205-0279-4a85-98aa-d00e603c4030","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1304.1098","last_updated":"2013-03-27T13:56:06Z","snapshot_observed_at":"2026-08-15T00:23:39.317725Z","submitted_at":"2013-03-27T13:56:06Z","title":"Occupancy Grids: A Stochastic Spatial Representation for Active Robot Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1304.1098","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Occupancy grids: A stochastic spatial representation for active robot perception,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/1304.1098","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:2f5740612edad1587fa71bb05e7343abce5d2ddd6cf01b10a6aa9447bd75b18a","observation_id":"2a017583-2025-415a-a5cb-6a88614ab482","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"A frontier-based approach for autonomous exploration,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:062fa71e5f5b00a5b97f29309737599e020481308bb0b9f97cfcb3ed4e4aaa39","observation_id":"422750fd-de7f-483e-8577-edb12fd81549","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Information gain-based exploration using rao-blackwellized particle filters,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:a97fd77a52b5814cac4f3d9f0466fdfbca2aa2e947cd896218ba13a43837c75c","observation_id":"4a29c07d-e87f-4229-ba10-40fa2b9788c6","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Gamap: Zero-shot object goal navigation with multi-scale geometric-affordance guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:78aea130a3c60f07c70970b7eed348bd4369362044cc4711e69e2069fe6f6c1b","observation_id":"5f96670a-d8de-4044-9e9d-eea88f0a39c0","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"L3mvn: Leveraging large language models for visual target navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:c370183eaf00536912b15273dff99ebf77b10292bf5ddf3d1019264469436741","observation_id":"a193f278-1470-4c96-bb39-37a1850a4e56","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:eb787ee15e5d24b2a0ba4b957910c1746fd301c8598b04707c1d484c69070a9b","observation_id":"a2a3ee19-2892-410c-8e51-7d8a77e153c0","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:f3e3b8578c0e653d556938bf315bfa50edf85b089c62ad8627372373825d03eb","observation_id":"22462d54-9508-4ef8-a93f-6e0834f090bb","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:a163e48e5b89c5df74e22409577009c2a7573da955847ae76141d2b4ece4a801","observation_id":"ed768df3-022a-48c8-adae-1b0ba64dc7a9","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"OpenFMNav: Towards open-set zero-shot object navigation via vision-language foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:ad83599b4177b4e2956ab08dc95f7f3bae87045e5b4a367ec69d9d578ad8611a","observation_id":"9507e9ee-f4c0-4ff2-9de5-f963df4d93df","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Egtr: Extracting graph from transformer for scene graph generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:53446066e87a8e38d73f4a01de28c4ea05a7fabaae9d7215b3d863b4927e4b4f","observation_id":"74175aed-4548-43bc-ae8e-b3906f67fe21","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Hi- erarchical Open-V ocabulary 3D Scene Graphs for Language-Grounded Robot Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:4f2ff0c7f2c1e64f8a16e1c7928ddd77f6d1942aec20e70c00a53132337b9434","observation_id":"5389475a-3a47-4205-a3db-5ae648be79e9","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Expanding scene graph boundaries: Fully open-vocabulary scene graph generation via visual- concept alignment and retention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:294ce943caba20e77d2e238344d6fd5db3ba6e6432319580370736911d178d18","observation_id":"9fd13e79-6973-4696-92ce-2953a7facb63","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Cognav: Cognitive process modeling for object goal navigation with llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:ed485bd12840442f980446dca71c03a8ffc268ccf07d360176375abe7abcd851","observation_id":"f4e1b900-4d03-457e-92b4-c0aadcf8c549","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Beliefmapnav: 3d voxel- based belief map for zero-shot object navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:0e9e3b50a33db67d585b1a1260f0e7481c50c1a4608962752034e9a7fb5890ad","observation_id":"e50425c1-1a04-4463-9ac3-e78fabd282b4","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Object goal navigation using goal-oriented semantic exploration,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:7ce2e0d63c211c70a22aa6bedce20ddcf675e8cc3e1763564f3d1098d8c42f84","observation_id":"dfbd27a7-057d-4c53-a748-9e96f56effc5","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Habitat-matterport 3d dataset (HM3D): 1000 large-scale 3d environments for embodied AI,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:4bc4128f6d8a01f49d94b4fb6d2066ffd75e98f194c111de4bb621b71fbda58c","observation_id":"d929c26c-16d1-43c2-a77f-57a031226a53","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Matterport3d: Learning from rgb-d data in indoor environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:c839db8b5de95a21b0604757eb803a9af81960292ae86c409f8fcc526bc84c94","observation_id":"9f9942e5-bbd3-4c18-8de3-a0ef9ac544b4","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Trihelper: Zero-shot object navigation with dynamic assistance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:1cd702a3cd13991beecb5fbc96284c76750d3327d00b81e855e94e3685a7bed0","observation_id":"5d0cc65b-40b5-424c-90e2-fb4bfedd6878","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"How to not train your dragon: Training-free embodied object goal navigation with semantic frontiers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:53a5c6a4fecd012b69a26e9401f45bebbd023790cfaefa1ab931fa099673c4de","observation_id":"bf0da835-7476-4d63-811f-5304dcff8de9","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Fuel: Fast uav exploration using incremental frontier structure and hierarchical planning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:dfc28e441d7f0d2012ea7897477472614fb6501fb61e20905e2fb678e7cc8d3e","observation_id":"9e5c6740-0425-4705-be05-4dd17b64711b","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Think holistically, act down-to-earth: A semantic navigation strategy with continuous environmental representation and multi-step forward planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:b79a0c9c69f8fb85a229c9cd8174fb05ab42361b54c782fe61965db2226313d9","observation_id":"a8a622e0-f555-4d40-a1b3-684ba0591a86","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Open scene graphs for open-world object- goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:caca0e180f5bd3990a4d94c61f4f87c2a9a06f601d36b3907381e4ed5ab44e02","observation_id":"cd5a7e54-6a4a-4643-84a6-91ee7833e11f","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Agent-centric relation graph for object visual navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:d3ca1e80b2cb95afdbd582f5d9b04c6d672ff1a2b9907a5b2aac88288d313887","observation_id":"61156cb8-76b5-4303-9e8e-532b688f8a68","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Imaginenav: Prompting vision- language models as embodied navigator through scene imagination,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:7c7a4e421852cd839316054310aaf73ceb21f80c47f5d671e6437a89593df993","observation_id":"beb2cef6-86b4-4c61-a403-8ee98f9aae9b","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:27e9806c956dd8c98a6e8668ec99e06efdefa193a038b3b423a55517d6cc8b33","observation_id":"e3dfd92a-bb50-42e0-a110-bb69bb6477b8","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:bd5dee6bb4b59aecafb56e1eb436cc87e763abbf5f6735670e75a1e8a5e3f041","observation_id":"05eb2658-667e-4015-8179-7f85b963f23f","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Chatnav: Leveraging llm to zero-shot semantic reasoning in object navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:55f6154c5509e16c47e8ea2965b2ef92b62d4ee7b9000df0ac20a41f6efbbd41","observation_id":"f2632f36-53a3-49c2-858f-6f2d1d164a4f","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"E²ba: Environment exploration and backtracking agent for visual language object navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:77f8e592eabfaa86fa8698fc09c2cba5ec835bf53f7fbb4e6601eee0d3a5aa4b","observation_id":"3649dc97-8331-421d-8d70-ddaa592d0f1b","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Strive: Structured representation integrating vlm reasoning for efficient object navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:3c177c34d2937ffedb4f646ab887d5037d082012b5da4382ac10b6cff32c92b1","observation_id":"b0ba9d8e-8ec6-4fc3-86a9-149c4d3179a5","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Visual semantic navigation using scene priors,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:b4f220aa368c59b2991b2a0cf81eeb4ee250cfc44203591a3c85b5f666a0cac2","observation_id":"ffaeb69b-ceef-4fb5-b252-f5004682a512","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Imagine before go: Self-supervised generative map for object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:caabaf14a0390d4f2541ddbfff6cecaa5784a6993fb5f7fad2be6b675bb1aaee","observation_id":"48e4afe0-a828-4c03-bf06-5a2a94f15a2a","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Hierarchical object-to-zone graph for object navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:83796e1bb16f077cf2f3f00adaa7d3f20797dc0d237f28b4c4c48f7aaa6026e4","observation_id":"ec82943f-9036-4602-94bf-d260b783dda4","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Search for or navigate to? dual adaptive thinking for object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:6f239aa0bb1dac7be745d2f30491ad46fa41b06565cd91d7be9bf1ee893ed930","observation_id":"0f547d67-5653-4d00-b199-d77e75053ac1","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Layout-based causal inference for object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:0f4f772f38ade414b02f884441cf39827d69b33a0cfca875527cf467ca2c0c0e","observation_id":"a57d928d-7ec9-4039-91c1-f435bcaacdc0","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Poni: Potential functions for objectgoal navigation with interaction-free learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:9d0f1c3351a415c17967a8f0594383904e45c4f91cb602d4c1e554040cbfd5cc","observation_id":"985abf22-8817-4706-bebe-607ce89eaf30","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Learning object relation graph and tentative policy for visual navigation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:faba161fdea14bfd8bb25e21efad7983b2e5d68493a10e8a639d305db8bea072","observation_id":"3fcb54d5-3554-4f55-bb2c-dfef01caf4aa","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Yolov7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:0d4853046c29e968e2f98c9dd4781276d7f02c8baacd1da85ba02cced367bf27","observation_id":"b25dea6e-8860-4165-98be-2444f0c34dbc","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:7a84dbe11d0537cd98768ff7bbbfd3d366939c06ffe2d5b25ffac8fb4909b424","observation_id":"613d9442-cc37-4e34-ba49-1f29faefd448","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-20T05:25:54.653744Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Faster segment anything: Towards lightweight sam for mobile applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:6349a9d53e18dda0617cc4a2caf50aaa0e65205da8b2d643aff96a874f00c977","observation_id":"6c30f039-8c2d-42e5-a8bf-61ad55d85adb","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T22:38:02.945576Z","title":"Unigoal: Towards universal zero-shot goal-oriented navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T22:38:02.945576Z"},"links":{"citing_paper":"/paper/2603.18444"},"observation_digest":"sha256:69e94fb374706c41b7704de877575897ed4afab2efab7d71cb1d0453768aca8c","observation_id":"07179b9a-ed6c-4973-bb92-8507893ebaf6","resolution":{"observed_at":"2026-07-13T22:38:02.945576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.18444","last_updated":"2026-05-23T08:04:22Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T12:46:59.473944Z","submitted_at":"2026-03-19T03:10:47Z","title":"Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2603.18444."}