{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3d68bd23a8728d587a71894a831be22d4424c70c6006979564eccaa615ec1b1","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:16:36.596455Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:04:43.641141Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11344","snapshot_observed_at":"2026-08-03T03:04:43.641141Z","title":"Guiding llm decision- making with fairness reward models.arXiv preprint arXiv:2507.11344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.641141Z"},"links":{"cited_paper":"/paper/2507.11344","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:8a0839783ffec98c986650b9b18cb319568b48317454fbb0837009de44383828","observation_id":"9610f636-a3ec-4be5-8de9-6de0de29ed12","resolution":{"observed_at":"2026-08-03T03:04:43.641141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11344/citation-record","integrity":"/paper/2507.11344/integrity","json":"/paper/2507.11344/citation-record.json","paper":"/paper/2507.11344"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.15281","last_updated":"2024-03-22T15:23:19Z","snapshot_observed_at":"2026-08-08T00:38:36.454068Z","submitted_at":"2024-03-22T15:23:19Z","title":"Measuring Gender and Racial Biases in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15281","snapshot_observed_at":"2026-08-06T17:16:32.884393Z","title":"Measuring gender and racial biases in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:32.884393Z"},"links":{"cited_paper":"/paper/2403.15281","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:8bdb38f65739a552335f78f6db0bbf8f9533a4331f405cf0805454997cc28cb1","observation_id":"cc0a3585-45aa-400c-838d-eacbb62a00c1","resolution":{"observed_at":"2026-08-06T17:16:32.884393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.870461Z","title":"Machine bias","venue":null,"work_id":"e30746bb-c3ed-4e11-9764-014098d12245","year":2016},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:32.959005Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:e7f131b2ad63e55e0181a42642a3611dafc508bc1c8201b3846f93aed63ae521","observation_id":"4590bfba-9322-4d44-873f-0f74b1f7c85a","resolution":{"observed_at":"2026-08-06T17:16:40.945369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T17:16:33.065618Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.065618Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:63e7ef39d09da20eec39559e6e1e3a0649eefb9ce585a67225bdee72df6fbfae","observation_id":"6913c2f1-197a-417e-ad0d-12708f06defb","resolution":{"observed_at":"2026-08-06T17:16:33.065618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.665170Z","title":"Fairness and Machine Learning","venue":null,"work_id":"0134028d-b6d6-4484-8874-852e0ab48dce","year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.157482Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:187d70b9bca05de7488d3b6e5d9aa59661d419c2836185038c92d230f6adc8a5","observation_id":"bef5e4b2-8799-4ec8-9c16-6493857ec85b","resolution":{"observed_at":"2026-08-06T17:16:40.754525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.257599Z","title":"Scaling test-time compute with open models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.257599Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:cba577c95173e70a673160ef1445fac8de80565cc1fb0618fb8b1a6730bee9ff","observation_id":"3eb81b7a-0873-4112-a139-5ff3577d6dc2","resolution":{"observed_at":"2026-08-06T17:16:33.257599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.528042Z","title":"On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM conference on fairness, accountability, and transparency, 2021","venue":null,"work_id":"1bb2eb08-6139-4a5e-8bd9-c671f75f0b32","year":2021},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.326485Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:30b404e254b4f646ff17ee6f0a1215e8ba1fe31e37bdc187e7a7988990f72be5","observation_id":"c4fe649e-1b8b-4dc1-89ca-8e56190bfcda","resolution":{"observed_at":"2026-08-06T17:16:40.598198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-06T17:16:33.404516Z","title":"Red-teaming large language models using chain of utterances for safety-alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.404516Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d7369c1b0c20652abf4e82a8582238af93361327e3671be6dcb7df217f60b57a","observation_id":"dc893af8-465b-4303-8687-e6e0658b8567","resolution":{"observed_at":"2026-08-06T17:16:33.404516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8560.33175","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.442680Z","title":"Nuanced metrics for measuring unintended bias with real data for text classification","venue":null,"work_id":"4dc3e92e-cfcc-42af-99ca-336cb406b300","year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.483416Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:91cc186b5794739d30b87b59be0c8bcdd4ce90a815d9a7a92af99985445621cf","observation_id":"92d27a1c-2a61-4ff2-90cc-dfa72e7dab6e","resolution":{"observed_at":"2026-08-06T17:16:37.508219Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T17:16:33.556042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.556042Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:4fc52fd863f9c1fb1a8c53b06666c6d74d58520eba4eef0155a5e25d44978cc2","observation_id":"4262d806-a84a-47fd-b2a0-ee476739ab06","resolution":{"observed_at":"2026-08-06T17:16:33.556042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.353588Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"9b35d276-2bea-4db7-b525-162ee5b899f4","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.639423Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:ccde8df1ebc4eb11255d73d35cc2281f937c394ce9cff47055c3e56613758179","observation_id":"239b4c31-6913-46f3-9ac9-11e8803335b2","resolution":{"observed_at":"2026-08-06T17:16:40.391505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.160346Z","title":"Fair prediction with disparate impact: A study of bias in recidivism prediction instruments","venue":null,"work_id":"3a701644-771a-4735-a243-9648e643859c","year":2017},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.697395Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:8aac90da6942e08190ff1a79468d72c35aa368c153095dd3577e6c5eed236214","observation_id":"dbf97b6b-53b1-4d69-a55f-9a8f909d4e79","resolution":{"observed_at":"2026-08-06T17:16:40.258768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.731709Z","title":"Bias in bios: A case study of semantic representation bias in a high-stakes setting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.731709Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b0562f2bea8dbd57fa45b5d6d2f419fc55b261e96316288047c62c0128c7d3ae","observation_id":"343f7e75-8f04-4cd2-94e2-ecf33192fb98","resolution":{"observed_at":"2026-08-06T17:16:33.731709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.808567Z","title":"Evaluation of A frican A merican language bias in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.808567Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b8ab2f18be7930e920a19f107f3d3d0f185202b5d0922b5cb0dfce63cf192904","observation_id":"00a43689-dcc9-4192-bb08-549b22fc27af","resolution":{"observed_at":"2026-08-06T17:16:33.808567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.964552Z","title":"The accuracy, fairness, and limits of predicting recidivism","venue":null,"work_id":"5652172f-0cec-47d1-9b3c-6f72e1eed965","year":2018},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.911279Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:bdae7d8faf8cf2fd72ede83cac21c83bdf09e3d530db6389ceb73e8e44459a7a","observation_id":"f03e6d9e-b996-492b-aec9-b8026dcf5c23","resolution":{"observed_at":"2026-08-06T17:16:40.061471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.978846Z","title":"Gaebler, Sharad Goel, Aziz Huq, and Prasanna Tambe","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.978846Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:4448523c40faadaa6518487371a3dc8c25f1d2d06ad28c882b757c47fa94b048","observation_id":"b10125fd-8937-4a2b-992b-c60ee033dfe7","resolution":{"observed_at":"2026-08-06T17:16:33.978846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.020800Z","title":"Gallegos, Ryan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.020800Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:a4bcf84507ded837a6f86fd071826dbfc1d9dc80c396047682b5747515a61a36","observation_id":"0451b8b3-e928-4242-98f0-b59fb8bd9c21","resolution":{"observed_at":"2026-08-06T17:16:34.020800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.109032Z","title":"Debiasing pre-trained language models via efficient fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.109032Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c7aaef3280ad73244c637ea47ad7d776c5aef1df67668304ee9bb37dbc8d8dcb","observation_id":"a90cb941-9963-4151-ac92-b617a720e87a","resolution":{"observed_at":"2026-08-06T17:16:34.109032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10915","last_updated":"2026-05-01T02:07:46Z","snapshot_observed_at":"2026-07-06T19:51:28.494860Z","submitted_at":"2024-11-16T23:54:53Z","title":"Bias in Large Language Models: Origin, Evaluation, and Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10915","snapshot_observed_at":"2026-08-06T17:16:34.192370Z","title":"Bias in large language models: Origin, evaluation, and mitigation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.192370Z"},"links":{"cited_paper":"/paper/2411.10915","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f69bb56a21897c2fb080f477fb74152dd76841e3e4aa079eb4852a2e31008217","observation_id":"7b79ff65-f079-4643-808a-ac6998336767","resolution":{"observed_at":"2026-08-06T17:16:34.192370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.720392Z","title":"Equality of opportunity in supervised learning","venue":null,"work_id":"5ec2627d-a177-4468-a8d3-3e55b003f5bb","year":2016},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.276605Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:336180a79bb0708cea4f823f77523f35a26dc0e0c73a19cc8787c8529327597d","observation_id":"bd06d18d-8403-4b1c-ab91-237c5b3ab031","resolution":{"observed_at":"2026-08-06T17:16:39.817344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.484224Z","title":"V- ST ar: Training verifiers for self-taught reasoners","venue":null,"work_id":"5cf1bda8-63d4-4df9-ad66-8e7955c0f888","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.383923Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d1fac64aac229b3a42c062f2bdfc2f25736d8c20059fa5c3cdb3dfb583879140","observation_id":"38241025-f83b-4642-b5c0-b8ff424c9674","resolution":{"observed_at":"2026-08-06T17:16:39.593074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17218","last_updated":"2025-08-22T05:59:31Z","snapshot_observed_at":"2026-07-06T18:05:59.538624Z","submitted_at":"2024-04-26T07:46:29Z","title":"Prompting Techniques for Reducing Social Bias in LLMs through System 1 and System 2 Cognitive Processes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17218","snapshot_observed_at":"2026-08-06T17:16:34.481000Z","title":"Prompting techniques for reducing social bias in llms through system 1 and system 2 cognitive processes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.481000Z"},"links":{"cited_paper":"/paper/2404.17218","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:62d4c6fc7ba1b6b296f53197af0c19a76c87dbbed59692969ceb94cd8bebb1f2","observation_id":"947a5ebd-3ab4-4f84-bdae-3aba1c02254e","resolution":{"observed_at":"2026-08-06T17:16:34.481000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15585","last_updated":"2024-01-28T06:50:10Z","snapshot_observed_at":"2026-08-04T20:46:47.002631Z","submitted_at":"2024-01-28T06:50:10Z","title":"Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15585","snapshot_observed_at":"2026-08-06T17:16:34.600067Z","title":"Evaluating gender bias in large language models via chain-of-thought prompting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.600067Z"},"links":{"cited_paper":"/paper/2401.15585","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:3d2ca272d8de9f324522fa21651ee9d21a35cc0bd5f1b72e20447ca23e978571","observation_id":"2332d80b-b2c0-4c99-a2ea-c78009ee6401","resolution":{"observed_at":"2026-08-06T17:16:34.600067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.308564Z","title":"Gender bias and stereotypes in large language models","venue":null,"work_id":"0f48f451-79e5-4c0a-84d0-e4b6c235b161","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.673173Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:ef2dec9b83e25a3dd7829cdded2ed3aa67aba01cd80f30814e0a134382c2a22b","observation_id":"a4162730-f66a-4fd6-a73f-a2ff60492451","resolution":{"observed_at":"2026-08-06T17:16:39.391977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.751145Z","title":"When do pre-training biases propagate to downstream tasks? a case study in text summarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.751145Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:0c9f4d52de8c63ccec62fa6257cb947a71fe798068ac74cb1d884b9a2cfc7bd5","observation_id":"53e20214-70cc-4ab7-9c6c-fc3770a5e16d","resolution":{"observed_at":"2026-08-06T17:16:34.751145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.831656Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.831656Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c86e87ab56884f726003a99a03b8ae1d3be54a48771ab9a64e0a42b903b6c3c5","observation_id":"be259f34-6ba6-4adb-8604-6aafe16ff023","resolution":{"observed_at":"2026-08-06T17:16:34.831656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.904157Z","title":"Debiasing large language models with structured knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.904157Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:2189bde1d66a3043a3e932d202beb7b2ff05f1b0a1c93ef9ca4575a57471de34","observation_id":"190bf357-95f7-4a39-aaa5-303b39125cf7","resolution":{"observed_at":"2026-08-06T17:16:34.904157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.102241Z","title":"Fairness-guided few-shot prompting for large language models","venue":null,"work_id":"85667f45-38b6-432f-9234-00d5d6e09066","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.978458Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b4b3c6a2e13264fd4f8da334092a8ffeee0d2f469f3663a9f01219c5de709f54","observation_id":"2598aec9-9663-4997-98ea-eabef42f61dc","resolution":{"observed_at":"2026-08-06T17:16:39.143969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03537","last_updated":"2024-12-04T18:32:42Z","snapshot_observed_at":"2026-08-05T10:30:35.588186Z","submitted_at":"2024-12-04T18:32:42Z","title":"Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models","version":1},"cited_work":{"arxiv_id":"2412.03537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03537","snapshot_observed_at":"2026-08-06T17:16:37.099185Z","title":"Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models","venue":"cs.CL","work_id":"b5484507-8e76-499e-83be-e21e12eee761","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.106211Z"},"links":{"cited_paper":"/paper/2412.03537","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:9b402ff51141c02d2b11b4e2ae284b4bd42efe8f751d99d8a2bac75fbf6b22a4","observation_id":"9462b191-baa9-4f9c-94b9-b23826ce9b3b","resolution":{"observed_at":"2026-08-06T17:16:37.148249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:16:35.181824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.181824Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:513c676af056806af22fdb82a47725922effde248ab4426ac6426c2dd107f564","observation_id":"859b9ccb-1d88-421a-a44e-d564ed349bdf","resolution":{"observed_at":"2026-08-06T17:16:35.181824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.257114Z","title":"Bias in word embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.257114Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:e1863c8a6375c3b4eb452b5b63a1063c359a4b1f9e4737a6370b3f2477829930","observation_id":"783d5837-a48e-499d-a173-cb7bbc3cbe03","resolution":{"observed_at":"2026-08-06T17:16:35.257114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.331592Z","title":"BBQ : A hand-built bias benchmark for question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.331592Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:bd70d67d949b5b1541c35c5b36b6913553b461462c3ae5f6f7f48fc474a32e7a","observation_id":"9e44a4c7-fa98-46e4-9acf-a30085eee4c7","resolution":{"observed_at":"2026-08-06T17:16:35.331592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.390548Z","title":"Divine LL a MA s: Bias, stereotypes, stigmatization, and emotion representation of religion in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.390548Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c42dd4f43ceca4723dd938ee4f94eb33cf217ab1ceeb285d84525a4b0c3c1797","observation_id":"9cc90f10-3013-4f17-84e3-a0c5d69a5fa5","resolution":{"observed_at":"2026-08-06T17:16:35.390548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T17:16:35.420119Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.420119Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:2019623f309c4195d5b44e58494813bff88e8faa3ed66d641e5e727c455e4aa6","observation_id":"4ffbd460-dc6e-49e7-ad19-a74ea5f316da","resolution":{"observed_at":"2026-08-06T17:16:35.420119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.468808Z","title":"On second thought, let ' s not think step by step! bias and toxicity in zero-shot reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.468808Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:3a1c7b2118ae831ce87caa349fc5f5c81ac8733e33f3c181a4f42a3cc2436313","observation_id":"e61e2c6e-e099-4736-b1a5-13274a76cb76","resolution":{"observed_at":"2026-08-06T17:16:35.468808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T17:16:35.536089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.536089Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f0fcce5a4a672e563c60544d2cb1520fc5ef0328ee60c707479dc477c43565a2","observation_id":"245ea5f8-203a-4e87-bff7-c98f74010643","resolution":{"observed_at":"2026-08-06T17:16:35.536089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.586343Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.586343Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:a4f404c8f832807620babe8f241830cb76615e990464ed6eb194a2508b08b0bd","observation_id":"030d9034-1f56-404f-8756-deceb6222eda","resolution":{"observed_at":"2026-08-06T17:16:35.586343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09162","last_updated":"2023-08-31T20:02:47Z","snapshot_observed_at":"2026-08-04T11:25:28.135361Z","submitted_at":"2023-07-18T11:38:45Z","title":"Unveiling Gender Bias in Terms of Profession Across LLMs: Analyzing and Addressing Sociological Implications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09162","snapshot_observed_at":"2026-08-06T17:16:35.620778Z","title":"Unveiling gender bias in terms of profession across llms: Analyzing and addressing sociological implications, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.620778Z"},"links":{"cited_paper":"/paper/2307.09162","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:144788e923677a0cbcff8bc91cd2b6648bfcb7306ea9ab04b94aa636f0f45993","observation_id":"95250af8-c97c-46be-a444-562177b8bedc","resolution":{"observed_at":"2026-08-06T17:16:35.620778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.820453Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing","venue":null,"work_id":"74f5370d-8dcf-428f-b0f6-234577fc4cee","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.716278Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:67ddea8f3f5acf25ad4c447ed4355bd096bf9736238ed30360cd75113eb38379","observation_id":"8608611d-f52e-4665-9817-335e646aebb2","resolution":{"observed_at":"2026-08-06T17:16:38.931655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:16:35.783003Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.783003Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:19e9c34cf7b2e64777984b66ea780ec936ab51bcad7dee821cf8f26a271cd4de","observation_id":"d7875b3e-8f1c-4a5f-8efc-69c0403a9a3d","resolution":{"observed_at":"2026-08-06T17:16:35.783003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.621465Z","title":null,"venue":null,"work_id":"443e1693-a754-401d-9f54-03ba78273a28","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.833352Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b31dfc25d86e72a77b9a81ae26296039a6fb88d3008356ada967a5096250dee9","observation_id":"6c9db766-0caa-4e05-9fec-c551aea0eb4b","resolution":{"observed_at":"2026-08-06T17:16:38.742876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T17:16:35.915640Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.915640Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:3b0e92e3473d6c291c16490857541b29a1c8adb0bda5eaec6f9b2989d8d4ded5","observation_id":"3dc15b25-52bb-478c-806a-b86504c164a0","resolution":{"observed_at":"2026-08-06T17:16:35.915640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.989318Z","title":"``kelly is a warm person, joseph is a role model'': Gender biases in LLM -generated reference letters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.989318Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:2f1ce7aeedc72d8f4deb5ac26ca1e26c0d72fafef8004413cf64e2af7b7a4609","observation_id":"b12e44ce-f502-4ebc-bb0c-56257c9e3fd6","resolution":{"observed_at":"2026-08-06T17:16:35.989318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.352626Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":"53f19deb-5979-48d0-bf48-993b29bd705f","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.045452Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:41a62d11edb4daa3b7d376c4a9f4ff80e090c1f1b3efc7dfa6a8b051766dc4fd","observation_id":"29756c0c-8d77-4321-9d5a-05cec139544b","resolution":{"observed_at":"2026-08-06T17:16:38.444517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.088433Z","title":"Math-shepherd: Verify and reinforce LLM s step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.088433Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:7b33fa5cd67655f3b1ff15c8e3257b690281d529d7c0b6449e1409e1420f97ad","observation_id":"e181325b-299b-43e9-bb30-c8b23d172bf4","resolution":{"observed_at":"2026-08-06T17:16:36.088433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.146401Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.146401Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:bd17b943e7cd25a8017a5fb40d697ef5f0c538f8a02498f1138bcba1c3dd7e96","observation_id":"7c31743d-7da5-4686-854c-00a05a8c5382","resolution":{"observed_at":"2026-08-06T17:16:36.146401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.231787Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.231787Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:dec21227e297f2d773b29d8dfa72c976b1e27a0c1350b8a2757c3f42866924c7","observation_id":"772ded21-26f9-4b76-b258-59b652fba045","resolution":{"observed_at":"2026-08-06T17:16:36.231787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.189489Z","title":"Blueprint for an ai bill of rights: Making automated systems work for the american people, 2022","venue":null,"work_id":"7a48c1f9-417d-430f-8e7a-0aeac150a889","year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.304543Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c82db444382f9010321a8e6670d35533e20afb6272ceba4fb48ad2131843d99f","observation_id":"88bccc54-0090-4147-bc83-1e6642df3a25","resolution":{"observed_at":"2026-08-06T17:16:38.256514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.956377Z","title":"Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval, page 1578–1590","venue":null,"work_id":"06ddd081-1c06-4470-972b-339ea2faf970","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.347103Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c8cfe583ce84feef8ed34a663b249e3856a6f7584937d8263f6b4f0500c52cad","observation_id":"c54b5ecf-f6f7-4f39-9b13-2616c96509ba","resolution":{"observed_at":"2026-08-06T17:16:38.048677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.853744Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"ca7a0f0c-3399-4eef-90c2-e817193e9e17","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.376580Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:0f725a511078dcc8a81c2fbcc0e92821b357c9a4d65c7b8dfc75ff3f615dad1d","observation_id":"1d5547e0-35a6-46fd-99a2-8b8afe9eff28","resolution":{"observed_at":"2026-08-06T17:16:37.868649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-06T17:16:36.465705Z","title":"Scaling relationship on learning mathematical reasoning with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.465705Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:cece11430c73a6c57fdeee0d75f416db52cdbbc1e6d3a0574b6858fcfe1aac3c","observation_id":"cb3dabd6-abbe-4d12-8f41-a7466d145002","resolution":{"observed_at":"2026-08-06T17:16:36.465705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.730858Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"ac374e11-3b44-4833-9b91-65cdd9314235","year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.543036Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:7679d2848afa24b45c868ba868214d1aaa0e358e5cc3d530127200a56606d983","observation_id":"2b9ef331-a297-4a24-8175-a6f9d936f503","resolution":{"observed_at":"2026-08-06T17:16:37.780741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.639239Z","title":"Towards effective discrimination testing for generative ai","venue":null,"work_id":"c1304d49-0717-4151-a4bc-a7b48c849d17","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.596455Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:ee47ebdcd8215f311e115173f491693af06cb7c4c21b588a395995b547ffd74f","observation_id":"a49fec15-69e9-48ca-ac85-03ab78d9f5f8","resolution":{"observed_at":"2026-08-06T17:16:37.675829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T00:39:15.872422Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2507.11344."}