{"as_of":"2026-08-17T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f558bf5d9623b13cc0249e409d255f3be12a620a0f670700c89bfcd371d5ce65","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:58:57.173888Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04396/citation-record","integrity":"/paper/2507.04396/integrity","json":"/paper/2507.04396/citation-record.json","paper":"/paper/2507.04396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.662593Z","title":"The construction of utility functions from expenditure data","venue":null,"work_id":"564a1835-6320-44a3-a07c-dc84dabb5c2c","year":1967},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.056514Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:6d2091b0e38c491f92a1b6f30e1956600b32eba49656e89e9cb9e7a4bf1f9903","observation_id":"7b56e6eb-7c03-48ca-a495-2d65b8ae96e7","resolution":{"observed_at":"2026-08-06T19:58:59.723242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.248257Z","title":"Finite-sample bounds for adaptive inverse reinforcement learn- ing using passive langevin dynamics","venue":null,"work_id":"8a80d502-df81-4754-83fc-2282ba3069d3","year":2025},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.931328Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:f5ef446dc30461fc0382d7e8107cb6da79304a4aefb6323fc5723ade541ce910","observation_id":"20a30a65-8223-46c7-b36f-0cb97649882d","resolution":{"observed_at":"2026-08-06T19:58:58.304324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.288354Z","title":"The strong ergodic theorem for densities: generalized Shannon-McMillan- Breiman theorem","venue":null,"work_id":"c0af910c-c1bd-4701-af12-66f39113e5dd","year":1985},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.284327Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:e6deb68cf7df383b17db25a3c62c1b77bc048eb94ee4515c44978ee0b4009526","observation_id":"e4fa3006-cc10-42b7-9cf6-b5b4e3e08c9f","resolution":{"observed_at":"2026-08-06T19:58:59.340275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T19:58:57.173888Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:57.173888Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:bccfad04bb7eed1e153f75552b3ebb716ba1bdbbe61e3c49c855307a8ba5ff8c","observation_id":"4bb9b298-080e-455e-9c0c-ed38d1f1b1b8","resolution":{"observed_at":"2026-08-06T19:58:57.173888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14486","last_updated":"2023-06-29T00:55:08Z","snapshot_observed_at":"2026-08-16T18:14:04.173134Z","submitted_at":"2021-06-28T09:01:09Z","title":"Unifying Revealed Preference and Revealed Rational Inattention","version":4},"cited_work":{"arxiv_id":"2106.14486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.14486","snapshot_observed_at":"2026-08-06T19:58:57.317104Z","title":"Unifying Revealed Preference and Revealed Rational Inattention","venue":"econ.TH","work_id":"f2329eac-960b-4b88-9fb7-ea79e528baba","year":2021},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.400096Z"},"links":{"cited_paper":"/paper/2106.14486","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:c8322a4ad3acb0870c53be05fed06008e2fd59d53c39bad6f9eac9351560b26b","observation_id":"647bfaa8-b775-4bec-963c-d2dac5be68ca","resolution":{"observed_at":"2026-08-06T19:58:57.425926Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1206.4617","last_updated":"2012-06-18T15:02:28Z","snapshot_observed_at":"2026-08-15T00:56:31.470091Z","submitted_at":"2012-06-18T15:02:28Z","title":"Continuous Inverse Optimal Control with Locally Optimal Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.4617","snapshot_observed_at":"2026-08-06T19:58:56.195785Z","title":"Analysis of recursive stochastic algorithms","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.195785Z"},"links":{"cited_paper":"/paper/1206.4617","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:6b1be68a32cda62c2051b70b686e42b4fdae2b44a83af0a101c8b265cc87d5b5","observation_id":"95b75689-967f-4dd6-9368-cff862584bfe","resolution":{"observed_at":"2026-08-06T19:58:56.195785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.005257Z","title":"Langevin-type models I: diffusions with given stationary distri- butions and their discretizations","venue":null,"work_id":"38a87f6b-5a56-4faa-bbbc-f35f8a0a5f4c","year":1999},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:57.027640Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:23871f52dfdb6b2eb4974634c70789b7044bbb3135097bd092e247ba8f17d335","observation_id":"b5386775-11de-49d5-ad02-a64e1a954616","resolution":{"observed_at":"2026-08-06T19:58:58.104986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03691","last_updated":"2020-12-03T01:34:00Z","snapshot_observed_at":"2026-08-16T19:15:04.857580Z","submitted_at":"2020-10-07T23:38:47Z","title":"Regularized Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2010.03691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03691","snapshot_observed_at":"2026-08-06T19:58:57.853797Z","title":"Regularized Inverse Reinforcement Learning","venue":"cs.LG","work_id":"35deda01-8245-469a-aae4-dbf09d38892b","year":2020},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":500,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.819721Z"},"links":{"cited_paper":"/paper/2010.03691","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:e13378447cfcdf3ce013dd736ecccd57ce82456ebf352ebc0b2bfd5093452562","observation_id":"32b137b8-f760-406d-919e-53a95a647e76","resolution":{"observed_at":"2026-08-06T19:58:57.919764Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.413407Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":"c1fbe2a6-b9ba-4242-bf6c-67f756c2cdc7","year":2004},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1979,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.198530Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:7add9c1c558c7d751fe8aea33fb6c56823cbc8e8065ba34442c06225f08224b6","observation_id":"2569f676-3f3e-4db9-b200-5f4730b25031","resolution":{"observed_at":"2026-08-06T19:58:59.513129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03849","last_updated":"2017-06-04T04:26:02Z","snapshot_observed_at":"2026-08-14T21:16:43.585950Z","submitted_at":"2017-02-13T16:11:38Z","title":"Non-convex learning via Stochastic Gradient Langevin Dynamics: a nonasymptotic analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03849","snapshot_observed_at":"2026-08-06T19:58:56.687880Z","title":"Non-convex learning via stochastic gradient Langevin dynamics: a nonasymptotic analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.687880Z"},"links":{"cited_paper":"/paper/1702.03849","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:d66546629302ec86ed2dd7219b5c34c4d9b5c3cb48af78519a7fc3f1eb4795fb","observation_id":"bf50c81a-a70c-4880-8b55-b709b10d04b9","resolution":{"observed_at":"2026-08-06T19:58:56.687880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1110.4946","last_updated":"2018-12-15T18:54:09Z","snapshot_observed_at":"2026-08-16T20:29:04.914619Z","submitted_at":"2011-10-22T04:54:34Z","title":"Real-Time Reinforcement Learning of Constrained Markov Decision Processes with Weak Derivatives","version":3},"cited_work":{"arxiv_id":"1110.4946","doi":null,"metadata_source":"pith","pith_arxiv_id":"1110.4946","snapshot_observed_at":"2026-08-06T19:58:57.653769Z","title":"Real-Time Reinforcement Learning of Constrained Markov Decision Processes with Weak Derivatives","venue":"math.OC","work_id":"36b77133-ffe4-4bd1-853f-3bd320aacfb4","year":2011},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1984,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.988934Z"},"links":{"cited_paper":"/paper/1110.4946","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:cdfe4dff2a6be22640360dbb31817f1f7d843fc6a185464057aef89a4ed167a1","observation_id":"0ee527b1-8e4e-4cef-b3b4-bdec461142b5","resolution":{"observed_at":"2026-08-06T19:58:57.731086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-08-14T20:18:41.596978Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-06T19:58:55.741770Z","title":"Privacy preserving classification on local differential privacy in data centers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.741770Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:8f60f76c76c0eedf4bfdc3e87895c1b698cfc1f5c9e15ead8914cef308681028","observation_id":"c55b22dd-4e31-4762-95a5-666c22ad807c","resolution":{"observed_at":"2026-08-06T19:58:55.741770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.568382Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"c53183da-ef72-4d83-89a0-e2d045dbf479","year":2013},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1987,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.121608Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:6d5c1a70858847af5cfc8675d11655669f93fd73f8f6100793bb651969de2869","observation_id":"0c777eb7-1aa4-4dae-b8cb-49b465d09ccf","resolution":{"observed_at":"2026-08-06T19:58:59.616636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.594106Z","title":"Maximum margin planning","venue":null,"work_id":"b5977d49-4f2b-46f1-85b6-44428553077a","year":2006},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.519105Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:81f3b5ed51ee7c12a89cc5efe0ced454dd491cec587a99009fc4b285d5a7004a","observation_id":"e6cb46f9-24b5-46c4-9102-7ddb9239e337","resolution":{"observed_at":"2026-08-06T19:58:58.660502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.044760Z","title":"Identifiability in inverse reinforcement learning","venue":null,"work_id":"2eceff99-e6f9-42db-a277-53b5f34deb33","year":2021},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.530001Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:44def3151d00d15074911ca1be51fcf5930ba7f4a82fa202f47005fb4d16db3a","observation_id":"37034726-4831-418d-942c-ad481c0e2582","resolution":{"observed_at":"2026-08-06T19:58:59.115812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:59.186238Z","title":"Risk-constrained markov decision processes","venue":null,"work_id":"42ba8655-6cbf-4e39-8133-72af9d979752","year":2010},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.371670Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:085aad0ed6c24ed45a0c317dbe4acf2c2c5e89e5cccd65f64091eb8e9bac2944","observation_id":"8d32fc73-a7b3-4f8e-9a60-4926d3e02098","resolution":{"observed_at":"2026-08-06T19:58:59.238305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04888","last_updated":"2016-03-11T11:02:00Z","snapshot_observed_at":"2026-08-15T02:21:02.927164Z","submitted_at":"2015-07-17T09:30:03Z","title":"Maximum Entropy Deep Inverse Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04888","snapshot_observed_at":"2026-08-06T19:58:57.101600Z","title":"Revealed preference and its applications","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:57.101600Z"},"links":{"cited_paper":"/paper/1507.04888","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:2fcdf64f1841a4158eb4a90c680ce265b91e12d0f08ff6b5a90bfa42756264bc","observation_id":"33cd53aa-83c8-4483-82c3-9379582fd007","resolution":{"observed_at":"2026-08-06T19:58:57.101600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.717529Z","title":"Langevin dynamics for adaptive inverse reinforcement learning of stochastic gradient algorithms","venue":null,"work_id":"2ee4ffd0-ac03-47f7-a550-271f0dba6f86","year":2021},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.065314Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:e4499ce1ef5c6926132a869d3c56b697533a8ba893a2789d4b2082ecd7c78380","observation_id":"0e353394-f97b-4048-908a-7f3847e7917b","resolution":{"observed_at":"2026-08-06T19:58:58.787186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.943960Z","title":"A testable model of consumption with externalities","venue":null,"work_id":"8762a74a-3e46-42d9-9d05-b150c439d608","year":2009},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.622496Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:3621f434efcc1d21c275765b6e9ef515ef80a9698e5c656773efd0822acc0605","observation_id":"8d787def-222d-47e9-8df7-e8a05bcab7dd","resolution":{"observed_at":"2026-08-06T19:58:58.988265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.490088Z","title":"A characterization of rationalizable consumer behavior","venue":null,"work_id":"7ba63a36-12f5-4b30-a87f-179c9c9e8b68","year":2015},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.604226Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:e773029a79625f7a55d72682395734648acf90ddcaf0bdb6676884e6fbd2f136","observation_id":"1dc32662-005d-4093-b93a-1ef086834415","resolution":{"observed_at":"2026-08-06T19:58:58.549024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1206.6484","last_updated":"2012-06-27T19:59:59Z","snapshot_observed_at":"2026-08-15T00:55:11.459312Z","submitted_at":"2012-06-27T19:59:59Z","title":"Apprenticeship Learning for Model Parameters of Partially Observable Environments","version":1},"cited_work":{"arxiv_id":"1206.6484","doi":null,"metadata_source":"pith","pith_arxiv_id":"1206.6484","snapshot_observed_at":"2026-08-06T19:58:57.490769Z","title":"Apprenticeship Learning for Model Parameters of Partially Observable Environments","venue":"cs.LG","work_id":"e1325207-2799-42bc-a043-66ffde8f87df","year":2012},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.303015Z"},"links":{"cited_paper":"/paper/1206.6484","citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:1410c5f3a85d11b97cecfc1c6295301e1fb8a7cf9af6547c9306f3da3e4b3ace","observation_id":"34e537b0-045d-46d9-bc69-c994cef7dd9c","resolution":{"observed_at":"2026-08-06T19:58:57.566558Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.362609Z","title":"Implications of rational inattention","venue":null,"work_id":"142578c6-eab6-4510-be5a-fba058eaed71","year":2003},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:56.812338Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:1b2556e912b84713310cf80fd49b0391c553e049c9ecbf9f1332d903758b65a5","observation_id":"c0eb391e-3ab3-4faf-83cf-738ee6a8f88b","resolution":{"observed_at":"2026-08-06T19:58:58.416044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:58.848525Z","title":"Inverse game theory: learning utilities in succinct games","venue":null,"work_id":"5f4be506-8ab1-467f-809c-66ccab546a40","year":2015},"citing_paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:55.905717Z"},"links":{"citing_paper":"/paper/2507.04396"},"observation_digest":"sha256:a94fc76911b90c4b842e15c908dcb57c13c55ad0f8f05884ea42f4a2ae6a2244","observation_id":"aa3ce0cc-7668-4d19-8340-b4d61fb6912b","resolution":{"observed_at":"2026-08-06T19:58:58.883483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04396","last_updated":"2025-07-06T13:56:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T00:48:02.764161Z","submitted_at":"2025-07-06T13:56:02Z","title":"Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2507.04396."}