{"as_of":"2026-08-10T07:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e840302632f9c52483bda49bee3f492b48e756598ca2e23f1ddf7830e61195b0","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:18:56.115559Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.12478/citation-record","integrity":"/paper/2603.12478/integrity","json":"/paper/2603.12478/citation-record.json","paper":"/paper/2603.12478"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Learning Representations (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:b321998979696458fa5d43c12c11c0836efba8c7c6a4f5eff0aca19229dbcd4e","observation_id":"4a7d0024-858d-4fbf-a12d-d9b496af4e5a","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2204.14198 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2b9d77b5f799f5b3735e9fe362f7b36e78af9d76723ed7dbd67bb1adb37ddb53","observation_id":"2e0bd53e-96da-4cc8-9a63-7efccc8e4a6d","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:edd919e32e22b4a177c47e20cbf8d4dc05042fd127320c5ad7a3cf929d16d232","observation_id":"0f0c332a-9926-4067-9ed6-8ea8093502e8","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:1fcc344e94a0c73ee41e2436314af0792e7d427cd959c9e3870ccb1794623cc4","observation_id":"0a04d3e2-9a6d-4d51-9894-e6f6eb394290","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: In- ternational Conference on Machine Learning (2009)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:d5f04dc2a4f09a19afd93c8ef4f65e68bd0c6fc3733b762d3b0260ffe38e459d","observation_id":"a82f5c8e-8e54-4b37-b2dd-7b2cf0fed128","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2209.06794 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:7c361fb0a66fd6521e2492e9bf1e35e44f41fb0267483e9a272aeb2d80a903f8","observation_id":"a8cb45cc-1f12-467b-98a8-b83e968023ab","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2305.18565 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:5001bdb0bd6ab30ee2232b285daeb6b11311f701ae3367171e6b47d49f022185","observation_id":"99c275e7-cc40-4fa4-bae9-6b609fd4ef3e","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2312.14238 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:7a919995566e9f61d9a8cba00d024d2e9594b83b4680e801bcb11f2a3b579ffc","observation_id":"4ed0bff3-60de-48a2-b16e-fd75356f5992","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2305.06500 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:56224c2003a3dc829a62cf18b27da084d0fe18342bf52c0961a77572c1880717","observation_id":"19a03779-ebce-4734-9b69-e3428b5439e9","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2307.08701 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:86c73543c9b38de30571c0ac63b81e9c3d1dd9a095af45502044a0e86f37dc5d","observation_id":"373c864e-d433-4f13-9320-f32242baf30b","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Learning Representations (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2124dfc6174318c247f52c6418dd963b87e9201eee55971a61f8c2fbaee97ce7","observation_id":"b1efe7de-aafe-46a6-9037-599a60687907","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-08-10T04:48:03.058704Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2403.11481 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:0cb1e03f2d88f0c19d85a32cab4e316354e85426f1c9710819cd4a4caa74d344","observation_id":"3cc202b1-1d58-4256-b5b2-f7658fa03e0f","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: Advances in Neural Information Processing Systems (Datasets and Benchmarks Track) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:0b7937172c0ef9e2a7e5a136c1b49f673e1aee6fd3be3f1f0fd60555b55418e9","observation_id":"f5825c0b-38bf-4afd-98aa-7cedb14c99cd","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2406.11794 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2bb115f066812d93f9d96521aa2e202e8a870f2390dd4d9c5a7bb1020fefd6ea","observation_id":"d4a21d37-845d-45bd-b016-72ac107c4e97","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Machine Learning (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:05259b1f52e878493dcd0ec9bd0a2cdb82eae0e6ecdec2bce88ac4abe45dc4f8","observation_id":"bd1be087-3348-4874-a721-fc145e12ab77","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03003","last_updated":"2017-04-10T18:25:29Z","snapshot_observed_at":"2026-08-01T21:11:47.069345Z","submitted_at":"2017-04-10T18:25:29Z","title":"Automated Curriculum Learning for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03003","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:1704.03003 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/1704.03003","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:3d9de427bf89cdd1a6ff8abcf86d5aba81a43dd7375a6392ae4b7917b511f76b","observation_id":"7263e72a-c5b1-45bc-8b08-f1ed3794a744","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-08T15:16:15.308854Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2402.19479 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:105c4686e37c9ac783058021f7d8cea21bdcb85a96edb8f69c373ef77a1f16a3","observation_id":"8489af4d-554b-4286-a8a1-1344536ca1b2","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2203.15556 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:b37313912d2b61db20ea699d00a08a7f8295ba78c1a34beb864d2ac0f6a931ad","observation_id":"3b28dfa2-f385-4a92-adee-73897fee69df","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2302.14045 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:9fe02bbefdc4a8915583c9580bdd28fa72084ca596d3d3b7f88cb032e78bf855","observation_id":"374932b4-d66f-4f53-8136-af54dd112864","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Artificial Intelligence and Statistics (2019) 16 R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:1d3e4b764d2971e1968602b745c5211fc2c6b2fa3f037b82261efa9ec0ed3304","observation_id":"5537cc04-aec7-4ccc-b08f-41aa145e0313","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Machine Learning (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:e3b983dbe92f64fbb73dd00465b833939876cf7090f271cd7996d6c2d2c7013d","observation_id":"d5dd4010-6446-495f-8b7f-bfa5c1c5bc1a","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2311.08046 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:e41a5701c9cdece9f7dfe6404cef4db3e0072112cfec30b5e9d6b82c0c4127cd","observation_id":"7b7d15e8-e4ca-481c-bb43-2a4d3e557cc3","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2001.08361 (2020)","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:db74f40878bf4d57f50072457a7b2e411765f33e8c0e71b153cec4a9037cf404","observation_id":"f2508338-e980-463e-abe1-acb3f1291039","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: Advances in Neural Information Processing Systems (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:e299d1fcbb2227e217aced97aa307415ffd433192dd7857e1b4994c2f70f4dc4","observation_id":"e3c04ec5-5a03-40de-a8d9-a6e517aa172d","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: Advances in Neural Information Processing Systems (2010)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:bcfb931d9c3b9c3dbe87de427f0fe1639ee69b73a0ced297363623d342ba6840","observation_id":"d0d8852b-6753-4b1d-beb5-caa2e0531c2e","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00043","last_updated":"2023-03-31T18:01:36Z","snapshot_observed_at":"2026-08-02T17:03:44.521882Z","submitted_at":"2023-03-31T18:01:36Z","title":"Features of Gaia DR3 Spectroscopic Binaries I. Tidal circularization of Main-Sequence Stars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00043","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2304.00043 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2304.00043","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:1b928b50f09e5af5f987cd5e6ca0a7d9f37962ec36b9dd3ec3f95192e25de4d4","observation_id":"56be1ebe-47d5-42e3-9079-72b25ed14f90","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:960fb5ca0978e1b1da571a58e90c56c093edb69c5128b9a5bbad6e977639ec2d","observation_id":"5957f710-2b71-4104-9bb6-95e187d3dea7","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14411","last_updated":"2026-04-06T16:01:44Z","snapshot_observed_at":"2026-08-02T07:48:55.322538Z","submitted_at":"2024-11-21T18:46:23Z","title":"Multi-Agent Environments for Vehicle Routing Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14411","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2411.14411 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2411.14411","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:bc385e3f381f4595675e745cb7eaf539af51884cc0cb84990df6f37f6832d2de","observation_id":"7190e9ab-9f6e-4eed-9062-2e9d0cf64aaa","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:95372091ae690b2f3dca3af80b216c729b986c6bc4ee0ee1744d42199f0cb220","observation_id":"4a7feb1b-a207-4580-901a-1a6bc3e9a635","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2301.12597 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:505591ae716ee30fc1e069fe22b9f2266916aa01ab38b77879f4d1624e4dc03a","observation_id":"ac46780a-b3e1-4468-b605-e9081a229f8b","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:c34784a108cc9933da2e6632520b61227431678c2a368d205fdb66426eb795eb","observation_id":"6eb28991-bd78-4580-b91f-4860682acc17","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12345","last_updated":"2024-07-17T06:39:52Z","snapshot_observed_at":"2026-07-06T18:47:37.971415Z","submitted_at":"2024-07-17T06:39:52Z","title":"VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12345","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2407.12345 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2407.12345","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2b355d06518cff347416c7aed1c86368890bbbd393b4e25c09a0867fbe9444b7","observation_id":"179d5a54-7025-4595-b0fc-ccf5683f7223","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2310.03744 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:4576ff806dbc076117fb3dfb77b0c34ec9428d0d77ef5cf6c0ad3fdf7ece6463","observation_id":"4d46fb68-e116-4985-a102-4a795b3bd286","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2304.08485 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:65d49e70d5e2b735ca9fe780199ae249cafb0941f43bafb663edeea10f8c94b1","observation_id":"1d2376b4-804d-4b90-b35f-186716b7a1cc","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2403.12945 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:fc4c31eb0f4ed6e75180a67767ee7d62c85150456aefb3a76210b89133768e0b","observation_id":"6ba7bcb2-0006-4b77-a763-39c25a817a98","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2412.05271 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:e996dad57b817efc58a97c93e70f2267435118ff51fe79fcb99fd2695957feed","observation_id":"dee7f6d1-78b0-4e3d-9894-7105307d1245","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2402.10452 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:dbb40b889aff3a7378edf2aa2daf3ad989431db60e4c5028a04ac4c00d21f2e6","observation_id":"b1e3c46b-4588-4614-8a2b-2cfd4b6d157e","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2306.05424 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:940b08e2e6637951115a95533fc86ac79e2ce216e41009a197a581ce9083f451","observation_id":"80231351-1fbf-4b6d-a5d5-ab36216cb4b9","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2312.15685 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:69727f26745c37ed15e2247d7963d2950dee4281575d0a2275f0307ca2061fa8","observation_id":"337e20e7-b511-4e8e-ac19-f5d43692ef89","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: ACL Short Papers (2010)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:0c0fb0436e91da4ff80c24884a83a18f3d40a693ace257280bfe39459c1aa5b4","observation_id":"c4f69774-d3ae-4a92-9629-9ff49e7d1e32","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:c2e7443be8e59eb3e1fdc2c83b2ebf0cfd83c2ddb81f7e80003a1e64877be48f","observation_id":"628064be-132d-4191-af3f-d0df2da7713c","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"Technical report (2023) Goal-Driven Data Optimization for Multimodal Instruction Tuning 17","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:29396bddeb093b58ab17ec50ebbf87da52c89107a50f44f3606cc6547a58c802","observation_id":"34fb270e-8bd2-405d-9744-bab686bda000","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07075","last_updated":"2023-03-28T13:51:14Z","snapshot_observed_at":"2026-08-09T20:08:32.231151Z","submitted_at":"2021-07-15T02:12:20Z","title":"Deep Learning on a Data Diet: Finding Important Examples Early in Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07075","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2107.07075 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2107.07075","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:f981ff7d3c29074a9ecf175a9b66da6d324d20f70f1cdaacb42f6ea579cc0938","observation_id":"ed43de6f-c7a0-4be2-869a-85a72305a2e2","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: North American Chapter of the Association for Computational Linguistics (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:ae78fc4155857a4184a8dd8807ed868f236b409530e44d1838607c5a5020b155","observation_id":"98d0cdb0-0008-485b-a502-13884cbb4a0d","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Machine Learn- ing (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:e51e2e84c6dd9b4284749405674483bcd63b57bcaa32aaea7dac465dffd7bc4a","observation_id":"13cf74fe-f010-4b41-a544-918c5e2528c8","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Machine Learning (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:c0a531bfba0971929301311bb9813bb0c769375d862045ff7d7ca4828bdac9fa","observation_id":"69170289-570b-47f5-a1c1-dedde309d1c4","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Learning Representations (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:ebc8cfc209400cf01bcab4aa70b61610e44146bcc9e69bc0d3078c1b03806d56","observation_id":"9ebbc48f-d76b-4edf-9887-19f112f17aec","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"Computer Sciences Technical Report 1648, University of Wisconsin–Madison (2009)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2885609b942707a0acdc76b9f808a06cf16a3b452cbc7eb29a213705269e18da","observation_id":"69c8f984-648b-4411-8ff0-20bdaf2c9275","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2307.16449 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:09b3393dc6ad98882fd7b484017eaf95d9b89a9f92c5e18c2e3052c0d2807ff4","observation_id":"86eb29da-14cc-4620-8d25-37ab3170b275","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"Advances in Neural Information Processing Systems (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:8c6c846b1f7b0f567ec72997ab7a6be7c828e649f5873f8964640b3feb38ef38","observation_id":"08c630bb-1ea5-430b-8a0d-113023e0b889","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"Technical report (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:419fc7b59d8fcb3dbd50733f43341f729fbeb0673779734b4adb6ea728c3ff5b","observation_id":"61b9ddf3-4330-440b-adf6-abb05b206208","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01234","last_updated":"2025-01-02T12:49:04Z","snapshot_observed_at":"2026-08-07T22:09:33.170355Z","submitted_at":"2025-01-02T12:49:04Z","title":"Impact of QCD sum rules coupling constants on neutron stars structure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01234","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2501.01234 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2501.01234","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:1c768881067446f55a412619b6788ee680ee018ac72154ec6364daccd19a889f","observation_id":"3cfa2a91-5aaf-4ddc-ab49-aaea34dd33b8","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Learning Representations (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2282567643a4197cefdb6f1b27246b98f9ace36b47ae9491466c8e96d5fd8fc5","observation_id":"b1ad4137-da32-4c7b-8016-6209358fb61c","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:665347223a8e0f8687944b7b945466ba9926992097bee633ac8ecd743dec3c22","observation_id":"a69cf7c8-6499-44c0-a096-b45172c67c9a","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2203.11171 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:6c6101f428837ea55de1a7520e4f8f254dc4b0dfc67bfc2c7ff2f3a3c693bbf5","observation_id":"a9d37f0e-6694-4c45-81d8-539839c941c6","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2306.04387 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:533354fed48eea4dee7a3f9f7ce6feef157762bde7d7d478c5da31a7cd6c8d91","observation_id":"b2e03eb9-624f-47a9-9882-fe769dadff86","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Lan- guage Resources and Evaluation (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:71df7342a1935eaabaf0a618d78b3e3e9393b2658ba5183a1367a0e6fd8c446a","observation_id":"930f9f12-1871-45d9-895a-cfd10f3f5128","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-09T20:12:15.213001Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05037","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2501.05037 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2501.05037","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:ecc5905fee8582d2eec81a084212d8bb8aa026a149da25b65246f212b115b836","observation_id":"e39ccf5c-5ad5-4945-9d88-75828525e7ab","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10207","last_updated":"2025-01-07T06:28:56Z","snapshot_observed_at":"2026-08-10T04:10:02.591961Z","submitted_at":"2023-10-16T09:19:18Z","title":"Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10207","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2310.10207 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2310.10207","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:1145933015a22ba4329a2a5ecf4fb471191ce0688565845135aa59bc77bbe6d1","observation_id":"b2d48929-8b5d-4653-ab48-acc13f3b4649","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: International Conference on Machine Learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:b577f3a3ebffce035209884b663e629121bd1c9152e1392576ac05141336d890","observation_id":"2b67b987-ad0c-471b-9ba5-d6c204c904fa","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11999","last_updated":"2024-02-19T09:46:17Z","snapshot_observed_at":"2026-07-06T17:32:06.610773Z","submitted_at":"2024-02-19T09:46:17Z","title":"CV@R penalized portfolio optimization with biased stochastic mirror descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11999","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2402.11999 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2402.11999","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:2e1bc5671e1f63a0361436de2b6a6aceb8dbe357e96c197626b56288b337a978","observation_id":"6ecc64d8-1313-46d0-9ccf-7f7e3033a312","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2304.14178 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:44af8e41c36d763dd53dff1a69099dcbc9b654a3e9258db51884997e42f0f725","observation_id":"6ab547cc-cda1-41e6-b117-eba8546c1d2b","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2205.01917 (2022) 18 R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:fa98f601742f1497df132d29406d48591ec5bebb9b1382870024d224a5b10fe9","observation_id":"de6e0b44-6348-4787-8d87-2b5c180c455c","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16846","last_updated":"2024-06-24T17:51:01Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:51:01Z","title":"Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16846","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2406.16846 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2406.16846","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:25352cec7809bd90b17285194a9dd30c8eb4a9290bb18c4b3f72f37349482708","observation_id":"f070ffc3-bd09-4c66-b7b5-73751b71a772","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06653","last_updated":"2024-07-12T03:30:42Z","snapshot_observed_at":"2026-08-09T09:40:50.398339Z","submitted_at":"2023-12-11T18:59:12Z","title":"Adaptive Human Trajectory Prediction via Latent Corridors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06653","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2312.06653 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2312.06653","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:dead2d0db17952f90f35db92d105310b150ebe3eeffc9815e9f196a17d06e8e0","observation_id":"5266deec-b657-4107-afa0-63cd60a82a2e","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2410.02713 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:a9e9bc7a4441c91602ad1a991559bd254d82d87443821cf1d8ae4932e1e3ca54","observation_id":"278396b2-5553-4096-b0c1-4af6154f1400","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2406.04264 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:c04232e6ba424d7f0f790965dde15245a9e0cc5e57ad6aab52e100e26899447a","observation_id":"f2bddea5-c4ee-4220-8806-849de6d24652","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-07-06T18:42:30.828375Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2407.05282 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:56a17ef3f3cfbe7b5fa1ba58387b6d95beac89175c6dbf1ef89a7773b0bbfa6c","observation_id":"ea08c8cb-be15-4370-99ea-784b3b36e2f9","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"Advances in Neural Information Processing Systems (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:a58e555d61c598d557d3f766f5248fa927c77c27bb85119dd699fcde292108da","observation_id":"53c617f2-ffc3-49d0-990d-86bc26ec02a8","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:f1cddd6c21890c04fe2b02b95f1862bc4772d8c707dabd2a230bfa0382c07174","observation_id":"8ff57f26-5a25-40d4-92b7-a00d5756823b","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:3ff81402366439a2754c966456984cbe47528f4ed6940e92b7c51151e68d1535","observation_id":"404c8226-f1df-4557-8f11-ae5ff33b7a4b","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2603.12478."}