{"as_of":"2026-08-13T03:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ea4108793acdd9b4c5e2adebb15f56a83e01a520a3df0471083b7a55534a822","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:19:45.731027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T23:08:21.673251Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2305.10415"},"observation_digest":"sha256:7147d6de1a249c43f23f9cc36cdfb0c01c4673207142739f2a2fb43a89740ea5","observation_id":"43b959f8-b5da-4dbb-89c9-e9adc90adbeb","resolution":{"observed_at":"2026-05-15T23:08:21.802896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:2b80be9523a4a90d8db87ab81d106053887be48af64e018e30a8db9d83fdc4ae","observation_id":"33f6ea4b-dd79-4aba-b544-0a251b110e92","resolution":{"observed_at":"2026-05-16T02:56:41.820282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":161,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:c01c34633bd4406017804c96d14685391add5deec16f69d1abaebc07e5c1d3d0","observation_id":"a9f82327-f41d-408d-a9eb-0d0f0314a681","resolution":{"observed_at":"2026-05-17T10:58:53.398463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-23T22:20:21.427717Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2402.11684"},"observation_digest":"sha256:3227ec39ddd16741f4f5b5c837fd7778d25df0a9382046059952fb3ba94d2e2d","observation_id":"2c650b40-4f4a-4d41-bb7a-cc3b06e5423c","resolution":{"observed_at":"2026-05-23T22:20:21.522610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T23:31:11.213552Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2402.13116"},"observation_digest":"sha256:ba09a663683ef587137900a11d33796a8b4b1a7caf7a0cd52224d7ad466d06b8","observation_id":"c39c5c11-79f8-4f80-8e00-22f304f144db","resolution":{"observed_at":"2026-05-17T23:31:11.672692Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-13T02:44:49.555221Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:2b2e2269e24a704c5864e282b53c48c4570a89b9442e5eb1bbf7438381d57e89","observation_id":"233cdd86-cc0c-4292-a444-a54f32b7ff39","resolution":{"observed_at":"2026-05-13T01:19:32.561482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:9b1f578b30a563f03bcaea9c14e398ffa3b4febdef84238185d858f4d3c75bcf","observation_id":"acdea6cc-2661-40b4-829c-5593e707556c","resolution":{"observed_at":"2026-05-11T12:33:33.939949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-11T20:03:49.116970Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:3d37054069856d438fd4a7255fa1a1832afb3f607306462cd5641d7944690f78","observation_id":"13a8d59a-a86e-4d9e-90e9-2a40123a5b4b","resolution":{"observed_at":"2026-05-17T10:46:28.649205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:59117875a0271e680fe5f2cf13c4f63aed3cfa7df7781d0c0a0d86ae1c288c3a","observation_id":"60a72d31-2619-46f2-9ead-8271ae6e6c22","resolution":{"observed_at":"2026-05-16T09:16:17.256298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T16:19:45.731027Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.731027Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:150ba8bc91ce6c77b465d74a8404c75b57de461867c004f1d8063533504c4e87","observation_id":"4a215b56-61d5-4b59-9c3e-91dad1ac794f","resolution":{"observed_at":"2026-08-12T16:19:45.731027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T14:31:36.751542Z","title":"Silkie: Preference distillation for large visual language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-12T14:24:51.823396Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:31:36.751542Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.15296"},"observation_digest":"sha256:437213ec169c843eeed628b5da68e92ab38c138a29e321f2e90621ecc3ca61fe","observation_id":"cd70d805-43f4-47f7-b63b-c1baf50175af","resolution":{"observed_at":"2026-08-12T14:31:36.751542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T13:31:10.635516Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16201","last_updated":"2024-11-25T08:59:39Z","snapshot_observed_at":"2026-08-12T13:21:01.538568Z","submitted_at":"2024-11-25T08:59:39Z","title":"Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:10.635516Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.16201"},"observation_digest":"sha256:019d28fce7e24b36f305e132a39edbd6ca68a287d0a0e0d90140abda3ddd09dd","observation_id":"9332e79f-d7ce-46ff-82ee-da5bfda82e81","resolution":{"observed_at":"2026-08-12T13:31:10.635516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T12:42:49.210147Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17760","last_updated":"2024-11-26T00:44:37Z","snapshot_observed_at":"2026-08-12T14:21:15.437536Z","submitted_at":"2024-11-26T00:44:37Z","title":"Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:42:49.210147Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.17760"},"observation_digest":"sha256:baeac3de07c84f26f3e8ed9130eeb385cc827c7a003df5aff9243268cbde9825","observation_id":"379e3394-eb4e-4230-89de-79b16e85e071","resolution":{"observed_at":"2026-08-12T12:42:49.210147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T11:27:33.204022Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.204022Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a7493d6295c0a1ff078de54bf033e89566e008b26e3aa29acd5c9808dea00198","observation_id":"a01a592e-44bc-406f-a3c8-a5ab89e09ed0","resolution":{"observed_at":"2026-08-12T11:27:33.204022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T11:03:01.124098Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18688","last_updated":"2025-06-14T04:20:06Z","snapshot_observed_at":"2026-08-12T10:56:39.039288Z","submitted_at":"2024-11-27T19:00:10Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:03:01.124098Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.18688"},"observation_digest":"sha256:96e24212ba137d34fc0f4445c002729f59facb9a5dceee7177cc8ee2c75c6908","observation_id":"6c9fc335-538d-4d28-a41f-de1ee3788a70","resolution":{"observed_at":"2026-08-12T11:03:01.124098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-11T21:15:45.306173Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-12T09:36:58.919478Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.306173Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:9b0360d7c61b92ff916a2241aac6f7bba4202ef1f7259b887c57185b46696311","observation_id":"752bf7ef-9dcf-48ea-a232-c45f7efea877","resolution":{"observed_at":"2026-08-11T21:15:45.306173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-11T19:42:46.513264Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06458","last_updated":"2025-07-31T08:52:39Z","snapshot_observed_at":"2026-08-12T04:15:03.344631Z","submitted_at":"2024-12-09T13:02:35Z","title":"Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:42:46.513264Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2412.06458"},"observation_digest":"sha256:ec464d01d4342a6929fb73da6ff35a213bd47b1563915f5630e7272fa5865d27","observation_id":"a7882aee-c046-4125-ad1b-239d7c18578f","resolution":{"observed_at":"2026-08-11T19:42:46.513264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-11T11:18:35.611659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15650","last_updated":"2024-12-20T08:06:00Z","snapshot_observed_at":"2026-08-11T23:05:21.327055Z","submitted_at":"2024-12-20T08:06:00Z","title":"Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-Evolution","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:35.611659Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2412.15650"},"observation_digest":"sha256:8292aea2c10dc1e3390e41310e6a5b7a4334f69706e906e07407f68898fccbc0","observation_id":"747aa7de-c4fb-409c-abd2-71b910309c24","resolution":{"observed_at":"2026-08-11T11:18:35.611659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T22:20:38.096551Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01926","last_updated":"2026-05-28T22:52:46Z","snapshot_observed_at":"2026-08-10T22:12:25.554762Z","submitted_at":"2025-01-03T17:56:28Z","title":"Cross-Modal Attention Calibration for LVLM Hallucination Mitigation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:38.096551Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.01926"},"observation_digest":"sha256:71e336cc3d752f113d27f0fc31874c300b9eca3b611d80cacd0bb3818ca5ff9c","observation_id":"37c30236-9aaf-494a-96cc-95933a978e63","resolution":{"observed_at":"2026-08-10T22:20:38.096551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T22:19:53.387458Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02135","last_updated":"2025-01-03T23:03:24Z","snapshot_observed_at":"2026-08-10T23:06:48.073542Z","submitted_at":"2025-01-03T23:03:24Z","title":"AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:53.387458Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.02135"},"observation_digest":"sha256:4004d1148b1a794795fd8356dd13bb0457b7255bacac14b5d65a5e31f1f7f1d5","observation_id":"eab059b0-6c42-4853-bc9d-45afcf1cf908","resolution":{"observed_at":"2026-08-10T22:19:53.387458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T22:06:30.452437Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02964","last_updated":"2025-01-07T02:55:15Z","snapshot_observed_at":"2026-08-11T09:46:47.694924Z","submitted_at":"2025-01-06T12:16:56Z","title":"Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:06:30.452437Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.02964"},"observation_digest":"sha256:a94a2eb0d4b0d7346c2bf10b1104b998ea48de760b1b9687e7b4e7e333b63391","observation_id":"044b9f2b-85a2-4e0a-a707-b6eddc44a1cd","resolution":{"observed_at":"2026-08-10T22:06:30.452437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T15:35:30.176415Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.176415Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:94e830b169bdc1f4f1aa99c33a0e995de02f4fe31655ee42bbf224b45883d6cf","observation_id":"8e534273-46d3-4802-b811-757a84634a33","resolution":{"observed_at":"2026-08-10T15:35:30.176415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T11:53:55.428207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-10T13:19:53.028871Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T11:53:55.428207Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.16629"},"observation_digest":"sha256:84ad67fc2673815bf623e42d4e038f0ade840e0bfbb8728edc8e43aa8cf024f2","observation_id":"f0d45872-f93d-4c1d-9d9a-f4c369859f78","resolution":{"observed_at":"2026-08-10T11:53:55.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T18:23:50.053172Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.053172Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a5555430096475db4ce9e2513c32a488eeb8a4b04cbcf1dc07900090fc1a4686","observation_id":"1a02d2a3-5dbb-4a20-85be-16e009ade606","resolution":{"observed_at":"2026-08-07T18:23:50.053172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T14:22:59.485200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19100","last_updated":"2025-05-25T11:33:08Z","snapshot_observed_at":"2026-08-09T04:49:33.633639Z","submitted_at":"2025-05-25T11:33:08Z","title":"ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:22:59.485200Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2505.19100"},"observation_digest":"sha256:071782f6ad97984e3358d8569e70fa5adf93dbee61373eb7ad088d154d90d67f","observation_id":"3a983374-25b0-4703-b8b5-674f6d89abe8","resolution":{"observed_at":"2026-08-07T14:22:59.485200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T13:45:55.178315Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-10T01:38:24.632537Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.178315Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:e9dfd7d74833d52305d2c525cea16fd4225b9d8bd74a423cb92378f5acf0bbc8","observation_id":"33fe8ba4-4dc3-4704-aafd-3cccd388b715","resolution":{"observed_at":"2026-08-07T13:45:55.178315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T11:55:12.792022Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-12T20:40:31.460384Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.792022Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:74203a5453fa2fc1810b9030cc3778902108869d6ef2571e5282f30dc6d2c792","observation_id":"0eb33f72-d27a-4a76-930a-3606de24e0fc","resolution":{"observed_at":"2026-08-07T11:55:12.792022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T11:11:47.407418Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.407418Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:6175ca2b7236199d63fff31b8332e7f885a9d16f2ffbe72115e318acee6c0f9e","observation_id":"2851502b-aa0c-47f8-bb4b-5bbecad3798b","resolution":{"observed_at":"2026-08-07T11:11:47.407418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T10:28:49.027723Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.027723Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:9b2b20acd2d17328bbc9c11f4a5641d0d5dfb4260b9bec72ff7d69a8d5f62b71","observation_id":"96db0a19-af0d-4def-b013-5187b34ca691","resolution":{"observed_at":"2026-08-07T10:28:49.027723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-06T23:27:19.350818Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-13T01:49:04.588780Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.350818Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c0fa2ca3345e08c667ddb09e636d94e84d5dfd57d9d1ef0567edbda59bad8591","observation_id":"c32024ec-ed48-4892-8f1a-7e24be6b056e","resolution":{"observed_at":"2026-08-06T23:27:19.350818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-06T17:21:35.238949Z","title":"Silkie: Preference Distillation for Large Visual Lan- guage Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-11T04:59:03.125246Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.238949Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:c353a6877451ff6ac071d824330a8c72168e47bdc5e12a8ea202793893e5c7c0","observation_id":"197ee628-b76b-4860-9504-86827db0aa01","resolution":{"observed_at":"2026-08-06T17:21:35.238949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2507.12455","last_updated":"2026-05-22T04:17:50Z","snapshot_observed_at":"2026-08-12T17:31:54.836477Z","submitted_at":"2025-07-16T17:55:43Z","title":"Mitigating Object Hallucinations via Sentence-Level Early Intervention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T08:31:24.173135Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2507.12455"},"observation_digest":"sha256:00cc370b7cd74467a04485043a8ed43dfded48ed8530171592fdf0ec190cb3a3","observation_id":"a5c9280e-2c3a-4799-be94-002e5bd50402","resolution":{"observed_at":"2026-05-25T08:35:32.553471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T20:28:48.508649Z","title":"Li et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:48.508649Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5528535f961b6e9fa00ed878a69bd48ae3b6d892edfbb6fb1d58af742e06a19a","observation_id":"da879e89-1fa4-4893-b6cd-b2135a2a2a45","resolution":{"observed_at":"2026-08-05T20:28:48.508649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T12:27:27.380128Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T14:14:58.948394Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.380128Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:ef3bbca583899a8bf9c9f141fccf1c3db6f8bb6ddda4287a456e152958d34383","observation_id":"82399be2-2ebe-412b-b0e7-3220ae1b890c","resolution":{"observed_at":"2026-08-05T12:27:27.380128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-03T04:20:54.615173Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-08T17:38:17.395786Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.615173Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:421d7eb09f5ceaefa893e170e7271ae5be6deb456afa70791c24b711e4b83a65","observation_id":"bcfcfc53-0e48-4a26-963a-ef15269b830b","resolution":{"observed_at":"2026-08-03T04:20:54.615173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2603.13054","last_updated":"2026-05-12T23:46:22Z","snapshot_observed_at":"2026-08-11T11:52:50.641494Z","submitted_at":"2026-03-13T15:05:04Z","title":"Topo-R1: Detecting Topological Anomalies via Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T11:41:27.021776Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2603.13054"},"observation_digest":"sha256:b58d56a254b7c8655da5b517dfe26f549bc4ee8024c0e281bfc1ca2f19096676","observation_id":"8fc7bf25-77a8-4a10-837c-680aa97badec","resolution":{"observed_at":"2026-05-15T11:45:32.848017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2604.10966","last_updated":"2026-04-15T22:13:12Z","snapshot_observed_at":"2026-08-11T16:44:47.257148Z","submitted_at":"2026-04-13T04:02:03Z","title":"You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:06:57.084550Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2604.10966"},"observation_digest":"sha256:e84786b40d26b787b69d34be7745066169d99f4cd8700d6459103f603f8b19bb","observation_id":"e06f9429-3404-4e78-868f-c91be94d3765","resolution":{"observed_at":"2026-05-11T09:20:59.335015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-08-12T20:15:17.290437Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:9dd1a3e986d8c7ed2b670bad47c1bd3852084a34e5234b3151e2d4eaf4eacc74","observation_id":"9a57f30b-4b80-4ea1-ab84-b05383e431fc","resolution":{"observed_at":"2026-05-11T09:56:00.855516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2604.18034","last_updated":"2026-04-20T09:59:18Z","snapshot_observed_at":"2026-08-06T22:17:27.223160Z","submitted_at":"2026-04-20T09:59:18Z","title":"SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T04:17:32.036750Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2604.18034"},"observation_digest":"sha256:469d86a9673c09fab8ca7fdc5864c62bfc7e4b83b3b8be07b85755c98aa4c717","observation_id":"529af750-587c-4766-b290-e9a46de366ea","resolution":{"observed_at":"2026-05-11T12:01:06.492898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2605.00323","last_updated":"2026-05-01T01:03:05Z","snapshot_observed_at":"2026-08-02T17:57:46.804255Z","submitted_at":"2026-05-01T01:03:05Z","title":"Online Self-Calibration Against Hallucination in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T20:20:27.931679Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2605.00323"},"observation_digest":"sha256:246d7029458ff28cfce691a98c32442709bb15a710f4b250f3e50549047bcf0b","observation_id":"bcfe1c6d-7f72-4077-a0f3-a9edb50883ab","resolution":{"observed_at":"2026-05-11T15:16:10.669193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:cf3e3497615c903bfabc53696fe16546b06ebe8a40f85d366445f47efe27b686","observation_id":"d2a7ace1-8370-4b84-a5ae-b6f5fe6768e0","resolution":{"observed_at":"2026-05-19T16:27:39.101866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:9af5b2fe30188500265642b0b1aaa0237788b1563d20b771ce6d2d747218af1a","observation_id":"792dae05-a8e5-47e6-8fdd-9ba7f06406cf","resolution":{"observed_at":"2026-06-29T23:04:01.994211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":"2312.10665","doi":"10.48550/arxiv.2312.10665","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":"arXiv (Cornell University)","work_id":"dd1b128a-36d2-47ff-a48e-98f5d1e734be","year":2023},"citing_paper":{"arxiv_id":"2606.25398","last_updated":"2026-06-24T04:52:04Z","snapshot_observed_at":"2026-08-06T04:56:00.009279Z","submitted_at":"2026-06-24T04:52:04Z","title":"MAPL: Multi-Objective Preference Learning for Robot Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T21:11:00.753949Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2606.25398"},"observation_digest":"sha256:7a7828a18852cd12a46c5e399ff10245b718f3fd598f85f06f50b2898263230b","observation_id":"34a67d23-2985-4dfa-943f-853f97b59a81","resolution":{"observed_at":"2026-07-04T19:40:06.232152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.990978+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.10665/citation-record","integrity":"/paper/2312.10665/integrity","json":"/paper/2312.10665/citation-record.json","paper":"/paper/2312.10665"},"outbound":[],"paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2312.10665."}