{"as_of":"2026-08-18T02:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70b9886dde6aa984321096518e4afad1b59df1fa9460bc78de98390ccc635a46","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:58:43.424797Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14797/citation-record","integrity":"/paper/2411.14797/integrity","json":"/paper/2411.14797/citation-record.json","paper":"/paper/2411.14797"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.868877Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":"1d31b0ee-7c56-44d6-af25-dfa4ca67716f","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.711922Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:e65d402eaa126f861905ff1447378c645c695dce8994b0e9e37171022737cfac","observation_id":"216260a6-88c1-4992-b5d7-7eb67303aaa8","resolution":{"observed_at":"2026-08-12T14:58:44.874415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T14:58:42.716829Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.716829Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:a592bccb718c313748156a314320e5ba8c7ebf2dbcd098cf8765199d580fb5e7","observation_id":"dd7b815f-e7c0-4a0d-b68a-e89f0ae32aad","resolution":{"observed_at":"2026-08-12T14:58:42.716829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.744185Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":"7977dba4-42d5-4ba0-99f8-7a5859e858f6","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.721830Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:fe68f435cb304545b72b354998cfd08b81db08ad6a27f713f8d587757dd9bd94","observation_id":"3228bcd9-5962-426c-a75d-b0cfe8b77cfc","resolution":{"observed_at":"2026-08-12T14:58:44.796661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T14:58:42.726082Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.726082Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:eb4690008ee0c9ea33f32132b0b1fa9233ea147e6aea6cc9e21604f03da24ec8","observation_id":"b4e405fd-7802-465a-b135-fa84d92fe807","resolution":{"observed_at":"2026-08-12T14:58:42.726082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.731110Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.731110Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:d2a812615f6159298f9132ff199600a55593ffa51c1f6b6f96b91cd0e0348fa0","observation_id":"d7adcc2f-a2a2-4e3f-be14-bc214a52c496","resolution":{"observed_at":"2026-08-12T14:58:42.731110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.623935Z","title":"DreamLLM: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"343262cb-ed81-4731-b59c-09953943bf3d","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.735944Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:546f920c61bdfb65decc00bf7ac037352a802a03b2f0b31eee2e6f3b22fa32d9","observation_id":"d7bd5977-be98-4522-9546-98d7487d143d","resolution":{"observed_at":"2026-08-12T14:58:44.676044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-16T14:03:07.999935Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-12T14:58:42.740552Z","title":"Towards analyzing and understanding the limitations of dpo: A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.740552Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:7fc7f018b3104d982fe0b9141533e5eccf38eae4704d08e9970d4a3c97b8e2a0","observation_id":"6fb41568-fb5b-43c1-93ad-7c7ab2d28a3e","resolution":{"observed_at":"2026-08-12T14:58:42.740552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.575094Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"798e0210-7bb5-471d-a548-c12196719c2b","year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.781559Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:f1ed7c1fe7fa703a58493038638b21a92aceb3526170fe509af6fb6ac31eb639","observation_id":"60aff75b-b0e4-404a-9576-bd5797658670","resolution":{"observed_at":"2026-08-12T14:58:44.592976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.863703Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.863703Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:3b25bd93384814106927a0bd483d2d45ab6b81325013dc686246d712919cd150","observation_id":"c9148c5a-5ee2-4f7d-b2e3-1c9ce62084fb","resolution":{"observed_at":"2026-08-12T14:58:42.863703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10884","last_updated":"2024-11-05T05:13:13Z","snapshot_observed_at":"2026-08-16T14:17:53.611601Z","submitted_at":"2024-02-16T18:42:08Z","title":"Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10884","snapshot_observed_at":"2026-08-12T14:58:42.961623Z","title":"Multi- modal preference alignment remedies regression of visual instruction tuning on language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.961623Z"},"links":{"cited_paper":"/paper/2402.10884","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:02fb1a066b62f4125b1fe3d72bf15976a16f32ed98f80144d707fd74f0b954f5","observation_id":"afb2b299-70bc-4c87-a29e-5d634b8226a5","resolution":{"observed_at":"2026-08-12T14:58:42.961623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.966247Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.966247Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:1677726bdf79cf834561e736f8b3766ce93eb8d833e8ce09612a4da4744a567b","observation_id":"67336aec-9136-451a-a5fc-e9949679a539","resolution":{"observed_at":"2026-08-12T14:58:42.966247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.538869Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"c5f7e79e-07d6-4a05-a5f4-2e06f3e0ff93","year":2014},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.970537Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:f872ea531db0d6e1685cec61d5c81179435b3e0a21cb8d65f5881e627d00d9a7","observation_id":"ca51b88d-cb91-4471-a5e1-e991a12a02ff","resolution":{"observed_at":"2026-08-12T14:58:44.544074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T14:58:42.975249Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.975249Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:70fcc482f57b87dc9aac29a2b016c840f7029c1c5a73e00bd1e87fbf36c9dfb3","observation_id":"af73828a-48da-4410-ab60-3ae07928687a","resolution":{"observed_at":"2026-08-12T14:58:42.975249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.980350Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.980350Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:2b65562419aae858d09347e38bb3cfb6c280ef3bdbe92688dd52e6fa50bb82a3","observation_id":"6780e922-21a2-4532-b766-7fd447b1d05d","resolution":{"observed_at":"2026-08-12T14:58:42.980350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.513121Z","title":"Visual instruction tuning","venue":null,"work_id":"e7da0b7d-b923-429c-b901-ba693bd855e0","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.984357Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:e8ea47742e36ea54edd59985e67930aa8e21baba601eda472e91308c82c4a289","observation_id":"f2f0c405-731c-449b-9866-dd977f7744f6","resolution":{"observed_at":"2026-08-12T14:58:44.518424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T14:58:42.989080Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.989080Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:8ec8b61e8ff3772abc3c3ac10a58e24509c3eed1fc4312ca501d1f8033a5d447","observation_id":"d472d0a2-332d-4488-a741-661c935fcb61","resolution":{"observed_at":"2026-08-12T14:58:42.989080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-08-16T17:37:51.594191Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-12T14:58:42.993918Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.993918Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:7200e93a90c5f93e06ca42d835427d987b697c589d94e99bbe7eededa3fcf101","observation_id":"a30925e4-dab7-415a-a62f-7d9533e6f59d","resolution":{"observed_at":"2026-08-12T14:58:42.993918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17931","last_updated":"2024-05-28T07:53:40Z","snapshot_observed_at":"2026-08-16T13:48:44.366737Z","submitted_at":"2024-05-28T07:53:40Z","title":"Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17931","snapshot_observed_at":"2026-08-12T14:58:42.998808Z","title":"Online merging optimizers for boosting rewards and mitigating tax in alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.998808Z"},"links":{"cited_paper":"/paper/2405.17931","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:1cda01a33bbceed68a1d9975989d42085f81fbf7e1596e1496ffe731b9a3cbaa","observation_id":"4a149c74-bc1f-48bd-bcf7-914f3eab9554","resolution":{"observed_at":"2026-08-12T14:58:42.998808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.005337Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.005337Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:62ebca54fe9b6057e772aa6fe2dee7253c37e834526777ba663063d2e08f3fe9","observation_id":"5c36a4d7-0de0-47d1-8af0-179aa8c5939c","resolution":{"observed_at":"2026-08-12T14:58:43.005337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.009885Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.009885Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:cc4a8dcb30e9f331de97cfacdfde5195b1db3edb7334df0786676a01d5aaf885","observation_id":"54b27ab6-d0a3-4c2e-8615-17d4a70fdf94","resolution":{"observed_at":"2026-08-12T14:58:43.009885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08730","last_updated":"2024-04-03T15:22:23Z","snapshot_observed_at":"2026-08-16T14:10:05.630209Z","submitted_at":"2024-03-13T17:29:45Z","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08730","snapshot_observed_at":"2026-08-12T14:58:43.014298Z","title":"Strengthening multi- modal large language model with bootstrapped preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.014298Z"},"links":{"cited_paper":"/paper/2403.08730","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:3bcf04d157364bdb623665e8eabea4d84dc939f31e8b360fd171baa658258560","observation_id":"0073ea85-db72-4aca-bd51-d7b67566ff5c","resolution":{"observed_at":"2026-08-12T14:58:43.014298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.477386Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"84f76c21-6682-4f12-92fa-a72ea9c06cad","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.018997Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:192291e1db4a776342e4777535e3b15afec4fa8f9b4c6afab4405b6f7041b808","observation_id":"bc6b0de0-f74a-44f4-a4ec-85938236add7","resolution":{"observed_at":"2026-08-12T14:58:44.482432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.023292Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.023292Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:5fc22e0720f11801509b36c542328086eba61492b747b07a5220a9893cfbace3","observation_id":"b85c0898-0943-4897-8bac-4a5da5a97b5c","resolution":{"observed_at":"2026-08-12T14:58:43.023292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.449988Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":"f1e93933-e664-4547-b710-c1887207c1c3","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.061051Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:1a3ecfbdb0a3c3bc67c1a550b09534ae58ff419f3f4a3a64e3c0746e6f7be149","observation_id":"c428b956-4f77-4182-9193-6431105f8112","resolution":{"observed_at":"2026-08-12T14:58:44.455332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T14:58:43.084563Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.084563Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:96becbd2356d4dc30f65e0a3aef49c58dfae09a321e8bca6b31b3952ead0e448","observation_id":"bacfa353-f4bd-4eb7-8b4c-ab861d80a813","resolution":{"observed_at":"2026-08-12T14:58:43.084563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.405409Z","title":"Towards vqa models that can read","venue":null,"work_id":"288878e2-2577-413a-bb29-86ffd77fb2de","year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.090981Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:cc94b83a3c89f46f613c1ac6f2060f5386abc33a6bf96ccf52e154490f53313c","observation_id":"e495b535-fcf1-4180-a3d4-a1768ff997bc","resolution":{"observed_at":"2026-08-12T14:58:44.438925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13733","last_updated":"2024-10-17T16:36:38Z","snapshot_observed_at":"2026-08-16T13:08:20.175225Z","submitted_at":"2024-10-17T16:36:38Z","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","version":1},"cited_work":{"arxiv_id":"2410.13733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13733","snapshot_observed_at":"2026-08-12T14:58:43.820840Z","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","venue":"cs.CV","work_id":"ee85e822-a5fb-4f02-b5d4-bea92b58c51f","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.096094Z"},"links":{"cited_paper":"/paper/2410.13733","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:3f324f945ca26949ae9e90d161729d8f41a1a1b461c3f37a80dc8d419ad5aa09","observation_id":"9360bab2-3464-492d-95d0-f3c01d58014a","resolution":{"observed_at":"2026-08-12T14:58:43.881132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-12T14:58:43.100804Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.100804Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:31836971d3a0812569e2d2be9e4795a3d975822fcad71b953bfcf2570768d391","observation_id":"0628616f-3067-4613-8c82-ca2b18bf89e4","resolution":{"observed_at":"2026-08-12T14:58:43.100804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T14:58:43.106019Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.106019Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:44615439d970c5140cc172830432fafabafd5a8338b7227a132276845b1cbf1f","observation_id":"a0a32663-3ec7-471b-90af-7515e6269bf9","resolution":{"observed_at":"2026-08-12T14:58:43.106019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-16T13:49:35.405713Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-12T14:58:43.111187Z","title":"Enhancing visual- language modality alignment in large vision language mod- els via self-improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.111187Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:b4968193605acf429ad440a2aa94330d2989a038022be562aea6468f7f79db09","observation_id":"fda87008-9453-4592-8f8a-c60a3b90b76f","resolution":{"observed_at":"2026-08-12T14:58:43.111187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-16T14:36:01.153196Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-12T14:58:43.116549Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.116549Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:7330377bd07082e778a9cd61458149bb6423c6ad092702eaec017c9c80770d6f","observation_id":"85960aff-4a04-42e4-9bca-69303c6d15c0","resolution":{"observed_at":"2026-08-12T14:58:43.116549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.313707Z","title":"Finetuned language models are zero-shot learn- ers","venue":null,"work_id":"473b2814-0c1d-4f32-b1c7-a4643bfddc7d","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.121904Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:8d6ba31c671af7897409610de656f07b8b88d5f78158d0d9bd68771a8f1c1ec9","observation_id":"ba68516c-f71c-4423-bcd3-ffdb9bd47ce9","resolution":{"observed_at":"2026-08-12T14:58:44.360844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.127468Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.127468Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:bfe6cbbeb4bea41308c697593804b39d318263b8f17cdc00f5a5d5651de0ebd0","observation_id":"e6e2386f-5a81-483e-8f08-7af1aca2430c","resolution":{"observed_at":"2026-08-12T14:58:43.127468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-12T14:58:43.132410Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.132410Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:655d701e7998de5e125bb90d202724041ea0d2e6187a265a6b7c1378529c38b1","observation_id":"2d472179-5ac1-45cd-a058-aaaf1c45f832","resolution":{"observed_at":"2026-08-12T14:58:43.132410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.204113Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":"14bb1ce4-e5fc-4ece-9e29-f8b3b4bc9fd7","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.137030Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:9bc3697fbed45b987774e62a7d5710b7aabd35466947f47ef410bc652b51e197","observation_id":"9c9d3f91-9754-4836-83aa-61b750e7b016","resolution":{"observed_at":"2026-08-12T14:58:44.258968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-17T13:19:57.452076Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-12T14:58:43.142427Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.142427Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:661bf11b869bce50acee69e98633552c14f872775602a1eb4f28576414589c84","observation_id":"f9cbea60-90fa-4966-b69b-2fd59088d728","resolution":{"observed_at":"2026-08-12T14:58:43.142427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.187729Z","title":"Token-level direct prefer- ence optimization","venue":null,"work_id":"a0bb3ebb-3393-4520-841e-06577c4cce48","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.147270Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:896e440618df8811b8ab01ab1e594bb02a882819932bc23355e518f86d952220","observation_id":"add161f7-45d0-4945-9a34-7804831dca39","resolution":{"observed_at":"2026-08-12T14:58:44.192399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09474","last_updated":"2023-07-18T17:56:06Z","snapshot_observed_at":"2026-08-16T15:15:14.074173Z","submitted_at":"2023-07-18T17:56:06Z","title":"ChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09474","snapshot_observed_at":"2026-08-12T14:58:43.151627Z","title":"Chatspot: Bootstrapping multimodal llms via precise referring instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.151627Z"},"links":{"cited_paper":"/paper/2307.09474","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:27fcb37797f594cd59b7e9c35144e069185e8427a6ca679a494e0bb5b9d41af4","observation_id":"18c45ca8-5129-42e9-9460-eeec3061e06f","resolution":{"observed_at":"2026-08-12T14:58:43.151627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-16T19:33:05.632918Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-12T14:58:43.156556Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.156556Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:0f9cf7921ab4b554aea7bab4964ee9f73f0544b737bf5813f1c19233b68e17b3","observation_id":"ad2f2b85-ab4b-4fc2-8a3a-d7efb8b3cadf","resolution":{"observed_at":"2026-08-12T14:58:43.156556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.170478Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"76bf2ab1-3179-41a9-b603-be6ad88fdfdd","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.204931Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:baf063bf9844e5f38b11d5ef20d2d7fb859eb2b793ea747b609732f2e3c82f01","observation_id":"117b7452-cfa3-4742-9915-59877dfd51ff","resolution":{"observed_at":"2026-08-12T14:58:44.177098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-16T13:50:10.927560Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-12T14:58:43.287932Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.287932Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:9b41629c25bb893597cb3b93efaeb6ff883f2970ba6c057a66f09cb8eadbdaf9","observation_id":"e6314292-d25f-44ef-ba1e-b1b1035789f1","resolution":{"observed_at":"2026-08-12T14:58:43.287932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:58:43.351600Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.351600Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:a6c9d970b634077223ef718e42d7a8249a5cf57edf279c9f35f850ea15632fb3","observation_id":"32679ab4-f065-4208-9c03-054790116fd6","resolution":{"observed_at":"2026-08-12T14:58:43.351600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.155180Z","title":"Multi-label self- supervised learning with scene images","venue":null,"work_id":"9e94a283-06d4-4380-b2a7-70651c2c9261","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.404328Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:3705a2c3a5d41ab55f8087504162c7498ff360401a8caa8dd1e03472449d91e6","observation_id":"36e81391-2f15-4795-b1f8-4a5ccb92b691","resolution":{"observed_at":"2026-08-12T14:58:44.159954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.138371Z","title":"Quantized feature distillation for network quantization","venue":null,"work_id":"dab6bac8-c165-4e87-8a91-bcdfc2cc5d47","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.409800Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:3b916e14ab9486bc3d0f282383cba6e049a9d0ea469deae07ddab784366a7d98","observation_id":"3e34811d-7d7c-42f2-9bb1-df6772bee8f3","resolution":{"observed_at":"2026-08-12T14:58:44.143565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10501","last_updated":"2024-08-21T11:36:47Z","snapshot_observed_at":"2026-08-16T14:00:32.744525Z","submitted_at":"2024-04-16T12:19:54Z","title":"Self-Supervised Visual Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10501","snapshot_observed_at":"2026-08-12T14:58:43.414905Z","title":"Self- supervised visual preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.414905Z"},"links":{"cited_paper":"/paper/2404.10501","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:15a992e7a4370b0f1a07be28476e825b486422e93f279758310b1d4a2ba122e9","observation_id":"d8ef4bab-6bf2-4feb-ac9e-bff7cffd3016","resolution":{"observed_at":"2026-08-12T14:58:43.414905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.122577Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"5ae3892b-69c1-468c-856c-32392a8adf02","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.420092Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:ab4bd83114e006e667d3e9c5dc3bcff60339dc5937a1e70f60974d183bfbf601","observation_id":"44b228c8-8180-46e1-9277-8d27eca911cc","resolution":{"observed_at":"2026-08-12T14:58:44.127762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.424797Z","title":"Multi: Multimodal understanding leaderboard with text and images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.424797Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:dea62bdfcce9de2e164663b8f921836fa4ecf776adb94eb96958c5d6d6e583b6","observation_id":"52625be0-87db-4cb8-a6ca-fd175383b8a7","resolution":{"observed_at":"2026-08-12T14:58:43.424797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T12:55:57.058373Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2411.14797."}