{"as_of":"2026-08-09T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12f3c44c607788bd603696994cb64a9df4eea4d808edc70ca4ca0f58ba1fc046","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:22:55.949459Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T20:28:39.249603Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:a216fa1faffe78dff603bef80481b83022bb554a038ebc4cbcb6bf0e124e794d","observation_id":"c15d0f86-cbc4-4ce8-95a1-a03c5f1703d5","resolution":{"observed_at":"2026-05-15T02:43:47.865942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-17T12:10:42.248005Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2305.17926"},"observation_digest":"sha256:b562ba91875b3d320d546182ad4075a1cecc837d3c842da95d32202c640e31fa","observation_id":"d1fd2764-d939-4d45-b502-d081c97b8057","resolution":{"observed_at":"2026-05-17T12:10:42.431540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:9b7e0633a92799df840771f291a82b2c6de957c92603247a88f9996ee670ca3d","observation_id":"d6c9abcb-4a2e-41bc-879a-535ab6a83d07","resolution":{"observed_at":"2026-05-16T02:56:42.695744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":282,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:8b8a01b349bdf1108f64e45df51a1a3b23fc3a334cb33db70b9b7257796e59ac","observation_id":"d7316a06-7a45-4489-8abe-44752f698298","resolution":{"observed_at":"2026-05-19T20:28:39.251990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:093566a994fd463fc2ef8e9eee2ce0ed5954b9b015d5d2812d953a2a77a3f809","observation_id":"149dc577-de54-4a50-a79e-d9dd3eb604de","resolution":{"observed_at":"2026-05-16T21:44:27.666644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:1217282f30b7730b847418e17c598d47d37573deb59259a15ca02ce8ba77be00","observation_id":"aacdd64c-0e17-4b4c-91b4-3f6d8bd4b716","resolution":{"observed_at":"2026-05-15T05:37:41.612505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:c4ec418433a7db48c550bd6ad8f5eedc06a1a876d18134625e85d9fb24e16531","observation_id":"ffad8371-cabe-4fd4-b398-09404bcf7c7a","resolution":{"observed_at":"2026-05-17T20:22:35.115909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-14T22:34:15.638114Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2312.08935"},"observation_digest":"sha256:9bdc1ba3359afbcc3da97ffcb41192bf26447eeec308d346121ac1a10aedfcb0","observation_id":"2e187d83-ad34-446e-8e3e-0793fa8f2fa6","resolution":{"observed_at":"2026-05-14T22:34:15.763258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:b84111586a3e80c253744b6d11855f7e2ed70dba89054469be8d1e5172e9622d","observation_id":"a9339ec0-f478-4a61-b0ed-a0e70d112f38","resolution":{"observed_at":"2026-05-17T10:58:53.407989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:f970788b243d081075393cc5c3f1d77b2c01794c9f744ba99a6f9b06b0e243cc","observation_id":"0d84ef2d-5fec-424d-922f-c386ee15a067","resolution":{"observed_at":"2026-05-16T04:09:36.478013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-08T20:22:55.949459Z","title":"M 3it: A large-scale dataset towards multi-modal multilin- gual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05086","last_updated":"2025-04-28T07:22:45Z","snapshot_observed_at":"2026-08-08T20:15:41.819569Z","submitted_at":"2025-02-07T17:03:57Z","title":"REASSEMBLE: A Multimodal Dataset for Contact-rich Robotic Assembly and Disassembly","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:22:55.949459Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2502.05086"},"observation_digest":"sha256:17fe6cc1d39c8bd612b184d0268cf8e04813ececc6a3c503f4525e7ee281349f","observation_id":"9ad6a6c3-1526-49b5-ad6a-a51aaf86e13f","resolution":{"observed_at":"2026-08-08T20:22:55.949459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T22:43:59.423255Z","title":"A large-scale dataset towards multi-modal multilingual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-08-09T14:14:17.759366Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T22:43:59.423255Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2502.09093"},"observation_digest":"sha256:20392c39580ce48a4416d98262c2a2cb4b6e480d7fda0650e12cfb520f139780","observation_id":"1c3a06e3-66d0-465f-a8e0-54b4e09ee35c","resolution":{"observed_at":"2026-08-07T22:43:59.423255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T20:06:36.629857Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:06:36.629857Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2502.09925"},"observation_digest":"sha256:4a2178b38da9de3363cf40dbef2160967f353726fb693d4ed965820db17cefe2","observation_id":"c8440316-70c4-4b2c-aeea-5864f1099fa8","resolution":{"observed_at":"2026-08-07T20:06:36.629857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T14:37:49.620424Z","title":"M3it: A large-scale dataset towards multi- modal multilingual instruction tuning.arXiv preprint arXiv:2306.04387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.620424Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b988b1c98215748aba56f00cd6081a9c8ea0f482f13145a6568e7772ecff6f0d","observation_id":"14856309-26db-41ac-9566-3a4537ffc053","resolution":{"observed_at":"2026-08-07T14:37:49.620424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T11:25:16.012128Z","title":"Computing Research Repository, arXiv:2306.04387","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.02510","last_updated":"2025-06-03T06:41:09Z","snapshot_observed_at":"2026-08-07T11:20:09.995225Z","submitted_at":"2025-06-03T06:41:09Z","title":"M$^3$FinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation Dataset","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:25:16.012128Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2506.02510"},"observation_digest":"sha256:a6f913de5907a5ecca9d8b725deb8186369e2da8d09ae1aca35464b764831c74","observation_id":"81be836d-7602-494e-8daf-47c9171aa506","resolution":{"observed_at":"2026-08-07T11:25:16.012128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-06T18:16:29.523026Z","title":"m3it: A large-scale dataset towards multi-modal multilingual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-09T05:23:12.933526Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:29.523026Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:e3ad9697277acfb08edfa8f3b661293c273aba907ef8372a82cd112af6ecbb91","observation_id":"c26c49ee-07bd-446b-9729-c1ceebb6150b","resolution":{"observed_at":"2026-08-06T18:16:29.523026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-06T12:09:39.711544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22037","last_updated":"2025-07-29T17:39:48Z","snapshot_observed_at":"2026-08-06T15:54:16.679483Z","submitted_at":"2025-07-29T17:39:48Z","title":"Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:39.711544Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2507.22037"},"observation_digest":"sha256:d3eeb610ab1b7ca032ff887b423e97e0fe7bbfc717b5a8eb7b971ed7ad00bb13","observation_id":"6b470d80-6eba-4783-a5b4-51126b5557e2","resolution":{"observed_at":"2026-08-06T12:09:39.711544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T23:32:17.831964Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.831964Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:090d4c071ac10b52cd069e4a605d7e58fcca4bcd18ccd4ec4cc8858da5b3efd7","observation_id":"4d0bd7e3-10c6-4259-acb1-704fa9e30622","resolution":{"observed_at":"2026-08-05T23:32:17.831964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T20:28:42.331519Z","title":"Dai et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:42.331519Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:47044dd795fba2b24e7fdb09161773cdbfc5ef05b7fd1f3256450de27842e6e9","observation_id":"07239a44-8713-4a3b-bcb2-c2b3efcf6a0a","resolution":{"observed_at":"2026-08-05T20:28:42.331519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T17:56:53.246219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:53.246219Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:563117c8e3ba946ffa20c2b5c0a0be49b2791b4bf2a03db975aca6fbf9962350","observation_id":"fe1cceee-ea0c-4c22-8a3e-da732ff23488","resolution":{"observed_at":"2026-08-05T17:56:53.246219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T16:30:12.596189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18381","last_updated":"2025-08-25T18:15:25Z","snapshot_observed_at":"2026-08-08T00:46:38.255768Z","submitted_at":"2025-08-25T18:15:25Z","title":"Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T16:30:12.596189Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.18381"},"observation_digest":"sha256:09cedf441716acb2f9574482183abea50a2d129f00b17a0703052f991e02159e","observation_id":"821da7d8-724c-49c5-a1a6-da96264ca380","resolution":{"observed_at":"2026-08-05T16:30:12.596189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2306.04387 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:533354fed48eea4dee7a3f9f7ce6feef157762bde7d7d478c5da31a7cd6c8d91","observation_id":"b2e03eb9-624f-47a9-9882-fe769dadff86","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2604.08212","last_updated":"2026-04-09T13:11:30Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:11:30Z","title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:39.410040Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2604.08212"},"observation_digest":"sha256:f4ff9bca9278eeabc178dac8c273f7489fc54bf18c35c23f73451494348d6c8a","observation_id":"196cf01f-10d5-4599-a8c6-801cdd4c3419","resolution":{"observed_at":"2026-05-11T06:41:21.206498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.04387/citation-record","integrity":"/paper/2306.04387/integrity","json":"/paper/2306.04387/citation-record.json","paper":"/paper/2306.04387"},"outbound":[],"paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2306.04387."}