{"as_of":"2026-08-16T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57cf7abb44bfc6d465c29925aefbf24cb1c9b0227434c87cc635982d0f4d7766","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:05:39.259063Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02109/citation-record","integrity":"/paper/2608.02109/integrity","json":"/paper/2608.02109/citation-record.json","paper":"/paper/2608.02109"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-14T23:15:54.149500Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-15T15:05:38.878942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.878942Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:8f747454aea79dbb6be8c04f75c16553d5517fb1d370d56c3ce6a3baea2bb3a2","observation_id":"f2e20f15-4aad-4c81-b0a3-03c8e487fc4e","resolution":{"observed_at":"2026-08-15T15:05:38.878942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T15:05:38.884799Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.884799Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:adb94278dceff6960b2cdfb5804ee94ef89d01673f413a6b271061af9aa76e67","observation_id":"122a4bbf-a213-4606-9a72-c082085fa194","resolution":{"observed_at":"2026-08-15T15:05:38.884799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-15T15:05:38.889309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.889309Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:4ed9b9c19e285c07971ed15f4827d01aa30006d74f0b518ed1b6dcfbfa7ab0b9","observation_id":"c434291e-f459-4b1d-bc81-80ace33e2e79","resolution":{"observed_at":"2026-08-15T15:05:38.889309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T15:05:38.894255Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.894255Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:de2f339a17395db9ac6f696a29a2964bfc18775710fc4913b9ea8e632e5a1afd","observation_id":"7a269769-031b-446a-ab56-b35732429a24","resolution":{"observed_at":"2026-08-15T15:05:38.894255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T15:05:38.899006Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.899006Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:c561bdc0c689f3bdf4fc79dcc4dbed35d5c1384e481aa746dcc92a3602c5721b","observation_id":"a6341cd5-84a7-4958-8a78-81f96c351f18","resolution":{"observed_at":"2026-08-15T15:05:38.899006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06881","last_updated":"2022-12-08T12:34:16Z","snapshot_observed_at":"2026-08-14T05:28:43.896417Z","submitted_at":"2022-07-14T13:00:22Z","title":"Recurrent Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06881","snapshot_observed_at":"2026-08-15T15:05:38.903759Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.903759Z"},"links":{"cited_paper":"/paper/2207.06881","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:a36cb3f8324f02b09e9b2c4f3746a87eab3cc3a5d2b2ec66ad08dacf54c80797","observation_id":"15780d6a-6352-4f09-bb0f-dccab7448ca6","resolution":{"observed_at":"2026-08-15T15:05:38.903759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-15T15:05:38.909045Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.909045Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:ab930feca35025eb209b4ee0834241c8370665b6213898e2b4a70fea98a1feaa","observation_id":"3d570310-1d71-4e50-bece-3d9557364fe9","resolution":{"observed_at":"2026-08-15T15:05:38.909045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:38.914062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.914062Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:cd674b366f55c77a6bf75f0339e0a404b9f7661fe0bacb31e40a3d1b68504773","observation_id":"f3579166-3080-4e9b-8a9d-d1cdcf9e3fcb","resolution":{"observed_at":"2026-08-15T15:05:38.914062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T15:05:38.919179Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.919179Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:1ebcb86980caeea4852bb3a9b0f6e60eee2fb7fc7a0938600c0a01886f6b19bf","observation_id":"e686ca1f-b861-4b0c-9034-1a07018299c7","resolution":{"observed_at":"2026-08-15T15:05:38.919179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:05:38.925881Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.925881Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:459bd9754b53aef98b8bb622fdfd2eb4d949737399f20f9df92729384ec8488f","observation_id":"99a18838-5646-4c0d-9c32-4820b02fbb96","resolution":{"observed_at":"2026-08-15T15:05:38.925881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.495313Z","title":null,"venue":null,"work_id":"ab7006d2-d9a5-4fe9-a638-9552030ed8e0","year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.930633Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:e16de924f0d931333ce9dfe2b946d6530b32e061fe790f42a7599be4cb7b5ba0","observation_id":"7128fc20-e6ae-41b2-8460-877e3a76ee87","resolution":{"observed_at":"2026-08-15T15:05:40.500074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-15T03:29:22.305477Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-15T15:05:38.935471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.935471Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:d5be4c07209686d2ed0243667abdd226d7cc83b96d76aa14adb950cdb4ba0faa","observation_id":"d6a17eba-25ec-4956-bde0-182c2bb964e2","resolution":{"observed_at":"2026-08-15T15:05:38.935471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-15T15:05:38.940204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.940204Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:34c7caaabb0c9b8a9835d2d391bec87ed55e94cee78b3dd38d426c1cf39452ad","observation_id":"ceee5c42-0271-44a6-bb0f-e56098888641","resolution":{"observed_at":"2026-08-15T15:05:38.940204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T15:05:38.945289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.945289Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:658f930ce70ae43fea05f3ba6fdc21d4510e4386406df56317c4232934750c27","observation_id":"9a462d50-4ce1-4b4b-8d4e-efb3bd1bf820","resolution":{"observed_at":"2026-08-15T15:05:38.945289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01282","last_updated":"2026-06-02T02:45:47Z","snapshot_observed_at":"2026-08-16T05:39:37.807645Z","submitted_at":"2024-12-02T08:55:19Z","title":"Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01282","snapshot_observed_at":"2026-08-15T15:05:38.950130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.950130Z"},"links":{"cited_paper":"/paper/2412.01282","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:aaab80174ee04af0c76cf2b71edf0273a32ba925e994aac1fcdd14906c8606cb","observation_id":"afdb7c0c-a9ed-4e25-b215-1f9461d4f9f5","resolution":{"observed_at":"2026-08-15T15:05:38.950130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-15T21:06:18.731250Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16629","snapshot_observed_at":"2026-08-15T15:05:38.955982Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.955982Z"},"links":{"cited_paper":"/paper/2501.16629","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:3930281679894acfffcf0943d99394a1f70e6fb53ad4faf94dd18a63de7d84d0","observation_id":"e6e19690-de7f-4d81-b8cf-0ca7fe80eba7","resolution":{"observed_at":"2026-08-15T15:05:38.955982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:38.960902Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.960902Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:329a552bc050f27cf1f809629213112b1e9485e868a390028d3dbe453bc4a7fb","observation_id":"14654f4c-20c9-4633-8e90-bdde020f68cc","resolution":{"observed_at":"2026-08-15T15:05:38.960902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:38.966056Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.966056Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:ddc4c3618b5e6e63baafd9a86a42d92168e8fe509119aaa4d2a2415c37126669","observation_id":"5a305122-6945-4e3b-8c6c-6fb89b8020a2","resolution":{"observed_at":"2026-08-15T15:05:38.966056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-13T04:59:53.332269Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-15T15:05:38.971671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.971671Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:2bdf1bfb11ac799bc02e1ef7a89d775c22521ca7674f707ec5937c7acb629b1c","observation_id":"52c18ced-9068-43dd-9e0f-81b5b3f1c1cf","resolution":{"observed_at":"2026-08-15T15:05:38.971671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-15T15:05:38.977554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.977554Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:0e282bde4f18ac287ba5a6c6790d44c14f1396890bc9c382821eb4aa18efeb04","observation_id":"a4c8773b-5102-4e38-89d2-d34bdceea5fb","resolution":{"observed_at":"2026-08-15T15:05:38.977554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.479311Z","title":null,"venue":null,"work_id":"66f6f4fa-2ab6-4fb9-b3b5-4d21d268eed9","year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.983124Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:0157d73cc61435bf680ea3a1ba29a3b56d99c51cc15e5df91b84b8b5006b33cd","observation_id":"4885b889-1337-4d9b-b3d7-29c9536011c9","resolution":{"observed_at":"2026-08-15T15:05:40.483715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-13T20:15:51.556270Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-15T15:05:38.990379Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.990379Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:d53ddd38db0f81a5475ff2dad23acde956e4ed3f10faeee833bb2ad6db76e9b2","observation_id":"a91ac6c3-9552-4fed-ae18-c46aa3d840f3","resolution":{"observed_at":"2026-08-15T15:05:38.990379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-16T02:28:55.314959Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-15T15:05:38.995166Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.995166Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:ec80a07c0ed222f834e634e1e2112392f65f09b2f8bdb23003f93d07768d9893","observation_id":"cd698b93-d591-4e94-91ca-a68829c8f023","resolution":{"observed_at":"2026-08-15T15:05:38.995166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-08-12T22:19:16.291881Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-15T15:05:38.999608Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.999608Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:5f29e6931598392aae9ec514740b60883ab1d5a3f9533f28216ba664a8f0b889","observation_id":"c073e57e-692a-41cb-ba7e-1f92411dba3f","resolution":{"observed_at":"2026-08-15T15:05:38.999608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.465349Z","title":null,"venue":null,"work_id":"1b6b260d-0ddc-4c68-be2c-637ddbb20ee7","year":null},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.004087Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:70e33ee7769176a148741fc4a7bad38257d40b0cc8b5f56a3ca08c2ecf4a6c48","observation_id":"408a7ae0-8aa1-497b-8b86-b65caa97e030","resolution":{"observed_at":"2026-08-15T15:05:40.469472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-15T15:05:39.119855Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.119855Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:717a294421e8010b63b9f95153d85f4df43aeb54018b72496a5c546fd53a3417","observation_id":"c19819d5-e2d7-4672-86bf-0257090288f2","resolution":{"observed_at":"2026-08-15T15:05:39.119855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-08-14T15:36:39.875900Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-08-15T15:05:39.124673Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.124673Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:f3cdf37ae64edc213f42b050cef1528769b595d3bfad6806fe7230ec87427416","observation_id":"3ed4cbcc-c8fc-449f-9e6f-5cdee72dc136","resolution":{"observed_at":"2026-08-15T15:05:39.124673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-13T17:24:28.063798Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-15T15:05:39.130457Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.130457Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:25dbd28a504b873f10665631c822754e1ea7bcf11b4d94864fa3d4dfe999ceca","observation_id":"a7b389be-c157-4fb7-a998-615c3aa76909","resolution":{"observed_at":"2026-08-15T15:05:39.130457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01814","last_updated":"2025-03-26T16:07:40Z","snapshot_observed_at":"2026-08-12T20:07:47.319651Z","submitted_at":"2024-12-02T18:56:06Z","title":"COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01814","snapshot_observed_at":"2026-08-15T15:05:39.135041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.135041Z"},"links":{"cited_paper":"/paper/2412.01814","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:cf5e00549d61f09c809a77deebd4eecfb8eed4fe52d18df8625d1256c3914376","observation_id":"246c281d-8ea9-41bc-ad28-d4d32daf4b45","resolution":{"observed_at":"2026-08-15T15:05:39.135041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T15:05:39.139785Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.139785Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:153f2ed8ce2011d4866c1954686936085ed2d61e503aa732d68d06bb50cfa570","observation_id":"3d85ad31-5ab1-44b6-b987-4ac3dd9a3f54","resolution":{"observed_at":"2026-08-15T15:05:39.139785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-15T15:05:39.144200Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.144200Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:a827feb3bb61e9a7342f3baa3ef94fd183b27c7b2fb508468f42be93763ca4e7","observation_id":"8f79445d-64f0-45ec-be70-5c1f129df163","resolution":{"observed_at":"2026-08-15T15:05:39.144200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-15T15:05:39.148919Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.148919Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:adcbb016cd39052e7af52a0e64fc1f7a13f9d4243a0f5577e690f129e45ef7f5","observation_id":"2ff6b79c-0b16-40a9-8f83-771f85e7c83c","resolution":{"observed_at":"2026-08-15T15:05:39.148919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T15:05:39.153250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.153250Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:c4cdd0b2dbe02973cf946cb78fce1f013ea4d76bc213c1752707da1190ee811b","observation_id":"20c34d17-b4a5-42b8-8d06-671c9f15e81a","resolution":{"observed_at":"2026-08-15T15:05:39.153250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.450718Z","title":null,"venue":null,"work_id":"b9d98ba9-2e10-4dd8-a97e-fcfc588f2cf6","year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.157276Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:c138642d29bce73ffa2b421da8faba9b671ca63fe9043868175b5a92fb08df06","observation_id":"54a80f74-4f8b-4165-bc22-7e7f72374958","resolution":{"observed_at":"2026-08-15T15:05:40.455152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.161252Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.161252Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:b557887f085d2c34464420476c389f35e5347c3c842d2bb2e22e6488b3dfacf1","observation_id":"cf17794a-01da-46c7-b547-b5673ab6f924","resolution":{"observed_at":"2026-08-15T15:05:39.161252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.433217Z","title":null,"venue":null,"work_id":"9af72843-c6b6-463d-82b6-7f41dfb8e4b9","year":null},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.165257Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:93d96ccdd702ad53274c3e01d7733b10dff7a3391645adc47496d0526d240aa9","observation_id":"091b3e91-be54-488e-9140-9ff738ad1f71","resolution":{"observed_at":"2026-08-15T15:05:40.437989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.417184Z","title":null,"venue":null,"work_id":"284d1c0b-14a2-4e75-a393-9edba6f6aa66","year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.174480Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:62e5add215b06d141377196e98ba86b06e73cecaed554fec9ef263bf93bf06cb","observation_id":"d6477539-5a82-4112-8942-80d44a97e743","resolution":{"observed_at":"2026-08-15T15:05:40.422236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.179349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.179349Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:76a1afa5b1ec4174e789262d07c4fd31f2c5bdaf918a455162626daad8c275e5","observation_id":"8e0536a6-0da1-49f9-bc31-e33b6a65a278","resolution":{"observed_at":"2026-08-15T15:05:39.179349Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-15T11:39:49.280087Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-15T15:05:39.183875Z","title":"Patil, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.183875Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:3c1a1e3bee8e55c9ad095bf698da2bc7cc4e92da09e754895640165bba414b97","observation_id":"12c064da-f207-4f8c-9140-f88d148e5afe","resolution":{"observed_at":"2026-08-15T15:05:39.183875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-15T15:05:39.189557Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.189557Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:b16a30c534f186365f4ec9ebdf48efcf00970e1986052266fd458e45c68d070f","observation_id":"840ab44f-5854-4793-8d1e-0de37425ead1","resolution":{"observed_at":"2026-08-15T15:05:39.189557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-15T15:05:39.194368Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.194368Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:74ccc901f745b05b02284247bcc564dc5b349907d743a3041dc096f5a06f9c37","observation_id":"b8fb7c0d-3620-4a2a-a09e-bf9c59d43142","resolution":{"observed_at":"2026-08-15T15:05:39.194368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T15:05:39.199163Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.199163Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:f7a9b3a596ec79b92774957a7cfe1eac35ac556aba11591bb61c192cb87bd77c","observation_id":"e852ce52-a38a-4cd0-babe-db0526a90792","resolution":{"observed_at":"2026-08-15T15:05:39.199163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-15T15:05:39.203992Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.203992Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:7c3d34165281dd057c62c099c6277059bcb7ec0f532a3464a70eef28e1ca073d","observation_id":"2f6da7a0-0b12-4cfe-abf0-5dec3c2bbdb4","resolution":{"observed_at":"2026-08-15T15:05:39.203992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.208704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.208704Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:f89327a4856176d4c435185fabbc58b3c525f06c696835859515f84e63861b62","observation_id":"b5f36794-acb0-4324-9901-c5ef471fe993","resolution":{"observed_at":"2026-08-15T15:05:39.208704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.390069Z","title":null,"venue":null,"work_id":"9dbf0703-fece-4e80-9622-ed45d8a42672","year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.214320Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:fbfff685b62b9618a4351f04a0e28987321a75e4690ceceb1a7ecdefe963a718","observation_id":"8f5ce23e-f39a-4aad-b4a9-db6231dc4522","resolution":{"observed_at":"2026-08-15T15:05:40.395155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-12T23:40:45.676888Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-15T15:05:39.218775Z","title":"Huang, Nan Xu, Sheng Zhang, Hoifung Poon, and Muhao Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.218775Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:e48da22fc8d085331d1562e31e1c7c1632bbe77d15756f6692f54fda8a999177","observation_id":"742c6bde-89ae-497d-8648-c824cab61b99","resolution":{"observed_at":"2026-08-15T15:05:39.218775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.223867Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.223867Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:a6fa3dfcd4aaacb88d00e9a57e44dfb1237662295ba219d93db602b588a25136","observation_id":"24a18a41-7db8-4639-b8b2-f9b0478cfb22","resolution":{"observed_at":"2026-08-15T15:05:39.223867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-15T15:05:39.229824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.229824Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:6360501ffb340100f6a4dbb33d42ac95dc3601e0b52d218fcdd8c43304f26259","observation_id":"21c67e3c-020f-49c5-9493-54af6ee44773","resolution":{"observed_at":"2026-08-15T15:05:39.229824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-15T15:05:39.234732Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.234732Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:5e6e22e4f028a1c1631d769a39cd2882c839f4d3321fb8c472fb9836c3f41873","observation_id":"cb0d365f-ad51-4bf2-b850-051cdceb9bac","resolution":{"observed_at":"2026-08-15T15:05:39.234732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-15T19:34:53.217001Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-15T15:05:39.239649Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.239649Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:0f7218cdeb48ce27fa830068d6586171eac5810589c18c9488247b3a3913a72a","observation_id":"aec5778d-8dd6-4566-928a-d877fdd3b8b6","resolution":{"observed_at":"2026-08-15T15:05:39.239649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.244627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.244627Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:329b92b40eaee978c441b7b1d6dc29a3df841ac8a88c835199bc938a4abc837d","observation_id":"d1f0b7f0-282c-4737-b84d-147c4bce3e6c","resolution":{"observed_at":"2026-08-15T15:05:39.244627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16617","last_updated":"2024-06-11T18:54:13Z","snapshot_observed_at":"2026-08-13T04:10:01.325494Z","submitted_at":"2024-02-26T14:47:35Z","title":"Long-Context Language Modeling with Parallel Context Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16617","snapshot_observed_at":"2026-08-15T15:05:39.249311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.249311Z"},"links":{"cited_paper":"/paper/2402.16617","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:0e7c0594a5aca0eb0878ab8debd7e84faf9e5990c3f0207d1f957ed9f70613db","observation_id":"2447ec8f-7401-4338-89b7-dd5e46daa117","resolution":{"observed_at":"2026-08-15T15:05:39.249311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:40.372789Z","title":null,"venue":null,"work_id":"19706b02-1808-41a4-a7cf-de086442aa9c","year":2020},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.254199Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:0edca1821561c14c80fe87e6ee70592d9e2a1220ba638a7822c1d716ee66bcff","observation_id":"9c02db76-1ac1-4e06-9a90-a13a24441e41","resolution":{"observed_at":"2026-08-15T15:05:40.379297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.259063Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.259063Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:ada495a004a8350d92f8bc904b8a3f32826f19ae9520d93603675081fde7cf91","observation_id":"87f4d7bf-7894-4ba3-91b1-23f245ca9462","resolution":{"observed_at":"2026-08-15T15:05:39.259063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14213","last_updated":"2024-08-26T04:59:05Z","snapshot_observed_at":"2026-08-13T00:00:56.281643Z","submitted_at":"2024-05-23T06:17:23Z","title":"From Text to Pixel: Advancing Long-Context Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14213","snapshot_observed_at":"2026-08-15T15:05:39.169449Z","title":"arXiv:2405.14213 [cs.CV] https://arxiv.org/abs/2405.14213","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.169449Z"},"links":{"cited_paper":"/paper/2405.14213","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:275d058cc3ae85349893c20a925c74bec385224a7f8ba3ec4d2f5db95e6746b1","observation_id":"325650ba-0ed6-4feb-844e-c92b23a3fc48","resolution":{"observed_at":"2026-08-15T15:05:39.169449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:39.114848Z","title":"arXiv:2601.10378 [cs.CV] https://arxiv.org/abs/2601.10378","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:39.114848Z"},"links":{"citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:bc65fc9c19f63915d68ddf467717136d92387af5fb7803db9af676671f8f3646","observation_id":"12f282e6-dd06-4e42-b782-895063f5a505","resolution":{"observed_at":"2026-08-15T15:05:39.114848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:36:08.169495Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.02109."}