{"as_of":"2026-08-17T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70c55527190a66ebc78f57e26dceaee7c63bfadd20eef80c57785cad32f9ec6a","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:07:54.567013Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:59:20.189439Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:30.511368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-08-07T15:37:31.014205Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14585","last_updated":"2025-09-04T11:31:24Z","snapshot_observed_at":"2026-08-16T09:13:34.470248Z","submitted_at":"2025-05-20T16:40:09Z","title":"Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T15:37:31.014205Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2505.14585"},"observation_digest":"sha256:e5b496c0d5f3f6425fd50b798c801a483acd5aa596cdcec46928befb9b52f004","observation_id":"c7e0e76c-dfb0-42dd-a0ac-40850cb5cca2","resolution":{"observed_at":"2026-08-07T15:37:31.014205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-08-15T19:59:20.189439Z","title":"Segmenting text and learning their rewards for improved RLHF in language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-17T08:37:48.840854Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.189439Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:8a8a9c58bb56ee28c3ab065a6b5568b5d8cdca430835e2979e9c708929db1bf4","observation_id":"87939929-964a-4e5a-88ea-1058304cd6c7","resolution":{"observed_at":"2026-08-15T19:59:20.189439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":"2501.02790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-07-03T01:37:30.511368Z","title":"Segmenting text and learning their rewards for improved rlhf in language model","venue":null,"work_id":"745c87a0-8433-4dc8-a1f0-b6df236314f6","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-15T05:29:27.850072Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3a726c38b8824255f956b551d68537ac3f103c8f51e0e3e370493b3dfad3149e","observation_id":"b5923323-4fcb-4b42-9458-093c65a4a7df","resolution":{"observed_at":"2026-05-10T14:00:28.401522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":"2501.02790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-07-03T01:37:30.511368Z","title":"Segmenting text and learning their rewards for improved rlhf in language model","venue":null,"work_id":"745c87a0-8433-4dc8-a1f0-b6df236314f6","year":2025},"citing_paper":{"arxiv_id":"2604.21160","last_updated":"2026-04-23T00:01:40Z","snapshot_observed_at":"2026-08-13T08:08:51.941239Z","submitted_at":"2026-04-23T00:01:40Z","title":"Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T23:00:14.031709Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2604.21160"},"observation_digest":"sha256:ec75761d423440722de982eaa67e041de497ea3b47bc6ad14ca13b4a2185bbc8","observation_id":"35917a05-ad3b-432d-881f-e8f9db0b75b6","resolution":{"observed_at":"2026-05-09T23:04:18.030277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":"2501.02790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-07-03T01:37:30.511368Z","title":"Segmenting text and learning their rewards for improved rlhf in language model","venue":null,"work_id":"745c87a0-8433-4dc8-a1f0-b6df236314f6","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:16ed4e4781d97b038f2ab40fe91a54cc347cd2a0a2b54d0e20ad1f6ff334707f","observation_id":"26de573c-73ff-40fa-a7b8-64a60a72c502","resolution":{"observed_at":"2026-07-03T01:37:30.512754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02790/citation-record","integrity":"/paper/2501.02790/integrity","json":"/paper/2501.02790/citation-record.json","paper":"/paper/2501.02790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.861114Z","title":"Adding hops early in the boil (usually within the first 15 minutes) primarily contributes to the beer’s bitterness","venue":null,"work_id":"756a25e4-276d-4776-9f2c-4900ee6dad98","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.489403Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:7f33bde774dc2d3d0961c5f7dcf113bf5d6d2e31c26df2a0949d34a09e07b2ae","observation_id":"52ba7fba-dc28-4045-8b69-1abab7b9054e","resolution":{"observed_at":"2026-08-10T22:07:54.866830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.843864Z","title":"The bitterness level is moderate, and the hop flavors and some aromatic compounds are preserved better than in the early boil, thanks to the shorter exposure time","venue":null,"work_id":"3973e971-a133-4f5a-ad55-b964312ef7e1","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.495412Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:b77dda2e0c96eca72f354c02d8ca9c8169cb35a98427a33cf8a3fee415c350d4","observation_id":"a4808866-602a-4262-885f-8183dba9a357","resolution":{"observed_at":"2026-08-10T22:07:54.849886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.827657Z","title":"This is because the shorter boiling time allows the volatile aromatic compounds to remain intact, while the alpha acids responsible for bitterness are less extracted","venue":null,"work_id":"f53b461f-8f52-4b75-b18c-22a378eb8c42","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.502124Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:238912ddfb5402f9b2667dde04d1bd2fcd3e48b0833acde1f8c973da0ebaa88e","observation_id":"f8a7153d-d537-44ad-80cd-1803f0f73d12","resolution":{"observed_at":"2026-08-10T22:07:54.832782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.809531Z","title":"This is done after the primary fermentation has completed, and the beer is transferred to a secondary fermenter or directly to the bottle/keg","venue":null,"work_id":"e5e59c1c-7230-49ff-b7b7-e7b0babcbd7c","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.507540Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:54c03aa0771ff1f216f4aa4fe518c661ebc01ccfe12f5384310bd570329445c2","observation_id":"c53aa61d-2c2f-467d-aabd-d7ecc2e0ebb0","resolution":{"observed_at":"2026-08-10T22:07:54.815952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.793813Z","title":"Spinach and Feta Egg Muffins","venue":null,"work_id":"85aa917e-60e8-42b4-93d5-099edd1a0267","year":2000},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.513187Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:fc750e383f2eb01c0d101b4ae4efad7724eb0ac7d5eebcbea22d95a7ab4af955","observation_id":"c11a862a-8a5f-4fc8-b73e-49575bc40e86","resolution":{"observed_at":"2026-08-10T22:07:54.798773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.692068Z","title":null,"venue":null,"work_id":"215c07a3-a6b0-4a38-ad90-408765274dc1","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.546752Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:131e3b84b949489cb9566f3c1a85f82c7bebb99db6c7e3835549631632ca187a","observation_id":"e29cbc92-e1e1-44a7-bc90-a3cf0df62939","resolution":{"observed_at":"2026-08-10T22:07:54.696961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.777039Z","title":null,"venue":null,"work_id":"5bf6a596-b5dc-450a-badb-985618e19d84","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.518774Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:815ec2a9f1ef799cbae250116ac76de259689943a50aa70f5822f2d89c85164f","observation_id":"ae4b4585-9915-4c02-88a2-e5cdf1012f28","resolution":{"observed_at":"2026-08-10T22:07:54.782680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.759276Z","title":null,"venue":null,"work_id":"78d6069b-8bc7-4f7b-be60-1bff04ba6063","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.524240Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:477922ce6c016be763cd8281881b5afcd63998a211397d5d788b311d0426e064","observation_id":"c5d1c61f-8afa-473e-a930-88a2e9e7b443","resolution":{"observed_at":"2026-08-10T22:07:54.764859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.741769Z","title":"Stir until all the ingredients are evenly distributed","venue":null,"work_id":"41215372-316b-47e1-b57a-40ec0659740a","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.529974Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:8b535ea711e74e2828344547ef31a613292662e896c490b3642f366e2b8e5143","observation_id":"d217ee92-7bcc-44e6-909b-8d5c96c465e2","resolution":{"observed_at":"2026-08-10T22:07:54.747472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.725225Z","title":null,"venue":null,"work_id":"f91ecf67-2d7b-4cf9-ad38-34bcb330fe6e","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.535681Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:ab96111d9e715c89170ba39455a015483ca3cea880fdbcd25f380a358ebefdf1","observation_id":"a7003008-5cf3-4e7e-8df5-2692f73807c1","resolution":{"observed_at":"2026-08-10T22:07:54.730212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.708891Z","title":null,"venue":null,"work_id":"0aa57aaf-814c-4bd6-bbef-e4b6e8fe6c8c","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.541559Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:d3f27001d1f7c6bcad2df23ddcaab530aa0178e9fef8d02a0dd8d9ba2d7d3147","observation_id":"d86e7d58-6d46-4edc-a883-1ca0aef06910","resolution":{"observed_at":"2026-08-10T22:07:54.713758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.676270Z","title":null,"venue":null,"work_id":"ca7cccf1-14d6-42df-8529-6512da980d21","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.551598Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:5baa77b350eaeeb9f8009ceb2e149c02eb20eac117b929ddc6f6e42b6a99ebf2","observation_id":"82ee1389-56bd-40b2-aa7b-54c17ac78e0c","resolution":{"observed_at":"2026-08-10T22:07:54.680867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.657601Z","title":null,"venue":null,"work_id":"e0bbc018-528e-4836-9ef3-4c4f3a85bec5","year":null},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.556760Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:3fa6c0b28da208d487a0b4cc8da449bca5ac511a38b88f6e0ef26cdfea5f593c","observation_id":"351e48cd-4793-4374-84c4-bd526a8923d9","resolution":{"observed_at":"2026-08-10T22:07:54.663422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.639717Z","title":"The roots of the equation are: {roots[0]} and {roots[1]}","venue":null,"work_id":"41e62b1d-26b5-4c51-8163-e646f888fd64","year":2014},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.561505Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:0db6127cf8b53c18fc686691adeda1264428e252e1f2e0d16546df83a300ae8c","observation_id":"71260a24-a3bf-4002-af9f-1297cf6609bd","resolution":{"observed_at":"2026-08-10T22:07:54.646193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:07:54.621512Z","title":"Global Statistics of All","venue":null,"work_id":"e05285ce-f4e9-4819-98bc-2f78e8f121f9","year":2024},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.567013Z"},"links":{"citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:46b334e5632d8db7340cb2bb444d0fd6a388fde8dc5cea36c23544a3640a6a49","observation_id":"e8176557-d097-4005-b745-46e67f6e0387","resolution":{"observed_at":"2026-08-10T22:07:54.628064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T22:07:54.481652Z","title":"my answer is c","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:07:54.481652Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.02790"},"observation_digest":"sha256:83c4164578900700ccfd4953473607d2045517db85c32a9ba4939ee83478bded","observation_id":"2eee8d5b-c2e1-402d-8d55-a6ea8292b7b7","resolution":{"observed_at":"2026-08-10T22:07:54.481652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 5 inbound Pith citation observations for arXiv:2501.02790."}