{"as_of":"2026-08-08T13:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16ea35a2fc5c88c4c0563c1854b4e13db05b2e7d3558386ec940f89bacee4ae1","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:02:45.938777Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:10:45.144421Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T09:38:43.272359Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"cited_work":{"arxiv_id":"2602.03491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.03491","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51675ea6-96c1-42b6-97f7-a04508b6e1e9","year":2026},"citing_paper":{"arxiv_id":"2604.17982","last_updated":"2026-04-20T09:04:49Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T09:04:49Z","title":"Mitigating Multimodal Hallucination via Phase-wise Self-reward","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T05:10:45.144421Z"},"links":{"cited_paper":"/paper/2602.03491","citing_paper":"/paper/2604.17982"},"observation_digest":"sha256:bbe4346bd960d3b591bc5f3d1980c7966af7420f43f156c0064b323491fc5549","observation_id":"f3904501-2dca-452b-a671-d1ec34ac2a69","resolution":{"observed_at":"2026-05-28T03:04:45.483203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.03491/citation-record","integrity":"/paper/2602.03491/integrity","json":"/paper/2602.03491/citation-record.json","paper":"/paper/2602.03491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:40.374433Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.374433Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:0f98429cb89358d6edff3fdb466fdae293a4ccf7443d87e431a78b7730b5eaad","observation_id":"a96168ff-0864-409e-9274-5187f1021601","resolution":{"observed_at":"2026-08-03T05:02:40.374433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:40.444113Z","title":"P ub H ealth T ab: A public health table-based dataset for evidence-based fact checking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.444113Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:ed25ee3eb68bf89fc36619ed25524f726e8ddebd2f0c9c22b2644f7248620f70","observation_id":"3c386893-da49-4d43-a0ac-b47dd6f68971","resolution":{"observed_at":"2026-08-03T05:02:40.444113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:40.527472Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.527472Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:c213038e4c63abe4c97a04c0db597e0bc863618b51cf6c31eb7eded59fb09249","observation_id":"366fc016-2765-49be-b27e-805256faa7e8","resolution":{"observed_at":"2026-08-03T05:02:40.527472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T05:02:40.578669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.578669Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:81018bfeb24828bc48f5c1711a9f8ee8578b48b5cd4de092ab36e1438c8da7ce","observation_id":"eb666695-a8e2-49f6-a2db-7e3bfd543aac","resolution":{"observed_at":"2026-08-03T05:02:40.578669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T05:02:40.827814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.827814Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:9e4cbce2d7d9c6a326296e7dba60e03ff18f6066458e13852cc739bb75308c5d","observation_id":"0560699f-674c-4eb8-bf64-da53fc79cdbc","resolution":{"observed_at":"2026-08-03T05:02:40.827814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:40.921830Z","title":"Deep neural networks and tabular data: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.921830Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:96951c668a9ea94027a0f775ec6a01340d047d77fbd08141ee217fb4263f4807","observation_id":"5c8a4522-171e-4b93-97b2-05af100dbf80","resolution":{"observed_at":"2026-08-03T05:02:40.921830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:40.984984Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:40.984984Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:2e97e90b8bf480a6c174d10ea042cc1451de8b1249a483bb11d354b7a442eb7a","observation_id":"63e546db-d8d2-4c1a-ae08-08c15baf63d9","resolution":{"observed_at":"2026-08-03T05:02:40.984984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.081979Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.081979Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:b8a869c1d4fc9d051c582b7c1fb4500f1ee735612a781b097ff59e6f312bc100","observation_id":"74e7b04e-88ee-4298-bf87-5c31cb86346c","resolution":{"observed_at":"2026-08-03T05:02:41.081979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.153759Z","title":"Vision-language models can self-improve reasoning via reflection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.153759Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:11ae92931aa8b2c08d5d4d2b60e7b4e60567c4e464fb5cf26703d94f3232e8db","observation_id":"189f5409-6c27-49fd-8262-49e08b6c6b5d","resolution":{"observed_at":"2026-08-03T05:02:41.153759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.315577Z","title":"H i T ab: A hierarchical table dataset for question answering and natural language generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.315577Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:1c9e0a35ba2f6a0cf355ebce4db04055fd423ca9d413bc6fa014b8c98b011b75","observation_id":"3618a62e-e520-4a98-87e4-6dc1c00d95ef","resolution":{"observed_at":"2026-08-03T05:02:41.315577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.438800Z","title":"R., Lu, Y., Yang, J., Roth, D., Florencio, D., and Zhang, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.438800Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:bea1264a952e95767b0da8ebb7cd629d2807cf569d5532ca89d9b6784f43a845","observation_id":"278ea329-4517-4677-ab09-dc1d8db7b25d","resolution":{"observed_at":"2026-08-03T05:02:41.438800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.541256Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.541256Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:9cc8d9c652ab212975b21b5e48bbdef934228b3c6cfcc7d265f0fc2b645ca48e","observation_id":"7b69bafd-3088-4011-a0c5-0878cf80f3ac","resolution":{"observed_at":"2026-08-03T05:02:41.541256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.654242Z","title":"INFOTABS : Inference on tables as semi-structured data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.654242Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:700e6063ad26b279df812da55896518c6b504c7f976170bd8756b9e58df5248a","observation_id":"d398df8f-c3c9-460b-b66d-9bcc584ca12c","resolution":{"observed_at":"2026-08-03T05:02:41.654242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:41.867758Z","title":"K., M \\\"u ller, T., Piccinno, F., and Eisenschlos, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:41.867758Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:da335da1b0ee8ec77db68d65a254d40deac86a29ab99d7d04326d87c67b637fa","observation_id":"f1984095-b767-4a48-b931-e49c4a03aeea","resolution":{"observed_at":"2026-08-03T05:02:41.867758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:42.032337Z","title":"J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.032337Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:e282cbcfb2ddb98547ad78e126ce6a8b084d522b5cb4484378a196fb80ae80b0","observation_id":"c839312f-92f2-4d96-ba62-0662538747ec","resolution":{"observed_at":"2026-08-03T05:02:42.032337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:42.194034Z","title":"TABBIE : Pretrained representations of tabular data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.194034Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:b4cdb1391c99069b51aafa0a56b5bfecc9e60b187786c65d7f7ef4f31da857c3","observation_id":"d17f7b36-2fff-43af-a08a-6dc4f2bdfbdc","resolution":{"observed_at":"2026-08-03T05:02:42.194034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.03960","last_updated":"2016-02-12T03:54:43Z","snapshot_observed_at":"2026-08-05T20:57:35.054495Z","submitted_at":"2016-02-12T03:54:43Z","title":"TabMCQ: A Dataset of General Knowledge Tables and Multiple-choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.03960","snapshot_observed_at":"2026-08-03T05:02:42.380233Z","title":"K., Turney, P., and Hovy, E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.380233Z"},"links":{"cited_paper":"/paper/1602.03960","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:e11a6671eefee3bd4ef469c741d2573560b52dc35938ea33ef2d78d4542ff4f3","observation_id":"cf35cd21-9e5c-45b2-bf9a-4871a7eb2d0d","resolution":{"observed_at":"2026-08-03T05:02:42.380233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04088","last_updated":"2025-06-04T15:46:30Z","snapshot_observed_at":"2026-08-08T10:57:58.673564Z","submitted_at":"2025-06-04T15:46:30Z","title":"Multimodal Tabular Reasoning with Privileged Structured Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04088","snapshot_observed_at":"2026-08-03T05:02:42.510199Z","title":"Multimodal tabular reasoning with privileged structured information","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.510199Z"},"links":{"cited_paper":"/paper/2506.04088","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:dcf5506ff2af86eecb9f448a0f797b7245b7cd73b5937eb259a9f5e56af38df5","observation_id":"9efd305c-9966-4c44-8704-9ab1cdce17f9","resolution":{"observed_at":"2026-08-03T05:02:42.510199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:42.664690Z","title":"Can GRPO boost complex multimodal table understanding? In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pp.\\ 12642--12655, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.664690Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:96e7047dc575750aa4543bd6ab1fca902c039c1bcf6ca1d9a15fbe7d1fc4c70d","observation_id":"5b6bb6cf-e4e5-45d6-a049-4017ebd954bd","resolution":{"observed_at":"2026-08-03T05:02:42.664690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:42.839670Z","title":"Ait-qa: Question answering dataset over complex tables in the airline industry","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:42.839670Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:7dd50d4bce757178949d625adca99dcaead885242f4222c44bf9c3b892201c25","observation_id":"54f68201-6f0d-434a-8c5b-c55468a9c11d","resolution":{"observed_at":"2026-08-03T05:02:42.839670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.095142Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.095142Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:a4bf532ee60120dffa27e2f6c746a554c466761717631e32f7def7de8a210a9d","observation_id":"29a8e89d-d813-4c87-b71c-77e14a6386ff","resolution":{"observed_at":"2026-08-03T05:02:43.095142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.298270Z","title":"Multimodal A r X iv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.298270Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:a52148fe316f563b84649c89fb7e85d83167bbfbd0e4243fd596b77bc6ef84fd","observation_id":"fd5983d2-6b31-4ef5-9e72-064afefc68b1","resolution":{"observed_at":"2026-08-03T05:02:43.298270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.510822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.510822Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:f6e00e4b91851e51a60ff3aa69a87cf019aec47eda871672aa808d766eb65152","observation_id":"bc47a30c-2318-4b94-8cc1-e63b557e98ae","resolution":{"observed_at":"2026-08-03T05:02:43.510822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.695962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.695962Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:d4780710ca7d5c8895f8de946e68adb809e90d4e865e001f31509e9680b7002e","observation_id":"b4c77cf9-7e8c-4bda-a361-625ca7d21fb8","resolution":{"observed_at":"2026-08-03T05:02:43.695962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.854060Z","title":"TAPEX : Table pre-training via learning a neural SQL executor","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.854060Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:ecc0257e9ed1fc68817bbc82a04267b95dc48026a53ff962ec0f3e624277ef7c","observation_id":"c25d1b99-9ee3-4bd2-b01b-85a1fcc8a7eb","resolution":{"observed_at":"2026-08-03T05:02:43.854060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:43.977441Z","title":"Hippo: Enhancing the table understanding capability of large language models through hybrid-modal preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:43.977441Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:a0768fbc5f1d84d988d3edb73520cdf03d908c4f32d5c15a90fd8e60b6689ad3","observation_id":"3e461837-2994-4956-9a81-fd75eb3f9343","resolution":{"observed_at":"2026-08-03T05:02:43.977441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:44.086960Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:44.086960Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:e290596b74ad25513fa01dd3d8de64b03f0a9661cbb198f36610bc73d8a2509e","observation_id":"b21b6af7-f9d7-4bee-b368-1fa2222760e5","resolution":{"observed_at":"2026-08-03T05:02:44.086960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:44.217419Z","title":"Large language model for table processing: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:44.217419Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:629812084e3344b5fd0f2e12289ca27d30e720c2b7b0c34256e26b363a44b89d","observation_id":"0678052f-0e0d-4a32-b5a1-6e36f0d1389d","resolution":{"observed_at":"2026-08-03T05:02:44.217419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:44.389351Z","title":"and Liang, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:44.389351Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:188b4e23307a3f49c92bf94e1415f901e1bf28f648759ea5cb17a2617fca22c6","observation_id":"e5797a1b-d794-4373-8b26-97d8dba2a7cc","resolution":{"observed_at":"2026-08-03T05:02:44.389351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:44.648919Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:44.648919Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:5fb07d73f2f567c5f59b20690485e37f6a9ab91db03eee6aef613459e0ac60c8","observation_id":"bc72ec60-401b-4613-8a68-14a8bc439497","resolution":{"observed_at":"2026-08-03T05:02:44.648919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:44.879105Z","title":"Table meets llm: Can large language models understand structured table data? a benchmark and empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:44.879105Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:6ee6c62b987be4c69fd9ad7092c613db4b118649165f8a6dc4d3f22d3ed07dc3","observation_id":"5ea8cc7e-59b2-42b5-8024-1c5c11293d03","resolution":{"observed_at":"2026-08-03T05:02:44.879105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T05:02:45.006686Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.006686Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:a4879389529d5b84cb921fa18491ac59604222962c88bf5b8209ac68d122bf53","observation_id":"7c435001-45bf-4377-873d-c99e8d02a151","resolution":{"observed_at":"2026-08-03T05:02:45.006686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21771","last_updated":"2026-05-23T17:30:43Z","snapshot_observed_at":"2026-08-07T13:21:02.167272Z","submitted_at":"2025-05-27T21:09:11Z","title":"MMTABREAL: Real-World Benchmark for Multimodal Table Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21771","snapshot_observed_at":"2026-08-03T05:02:45.118121Z","title":"Y., Trivedi, J., Baral, C., and Gupta, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.118121Z"},"links":{"cited_paper":"/paper/2505.21771","citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:1fbe32e1a6e78944bbdeaead6bf3fea0a18a8e7a52d738e1f20f2cb6f89ca116","observation_id":"77fd1f6a-69ac-40ff-ab25-a8e9ed3142d7","resolution":{"observed_at":"2026-08-03T05:02:45.118121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.216036Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.216036Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:9b1bc44cf3b86ad7226440d4d49947260e9bc6a81af9aaa23a55e7ca946f1003","observation_id":"97f06c00-4c13-4968-bd7f-ad4a48ed7872","resolution":{"observed_at":"2026-08-03T05:02:45.216036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.295647Z","title":"Tuta: Tree-based transformers for generally structured table pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.295647Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:5b7c814e02b75fcddfc1ebc6f595d7547c126d990279b4113901917fe4ca99d0","observation_id":"47e93e13-c652-4a0d-8ce1-d36f7ae29aeb","resolution":{"observed_at":"2026-08-03T05:02:45.295647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.384421Z","title":"Tabpedia: Towards comprehensive visual table understanding with concept synergy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.384421Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:d97bd9a42e7b51333859caa89b410dce6dbfa6768eb2a3975de90ee8cb415f9b","observation_id":"a333b059-4bd0-4215-a16a-de5250f31047","resolution":{"observed_at":"2026-08-03T05:02:45.384421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.570311Z","title":"Multimodal table understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.570311Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:ad3abdb721568b5719e40171497e1841cddb4c278c181cd99761df3b461696ea","observation_id":"a1709a1a-663b-417b-a496-325521b893ac","resolution":{"observed_at":"2026-08-03T05:02:45.570311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.663169Z","title":"Syntab-llava: Enhancing multimodal table understanding with decoupled synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.663169Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:8bb66d0e923a91b2f12c45ae0a56d8f78d0260e332588ed6e0d9bea50e9f01de","observation_id":"c6b29b89-e504-4f46-b6b8-e4cfab3b727c","resolution":{"observed_at":"2026-08-03T05:02:45.663169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.805430Z","title":"TAT - QA : A question answering benchmark on a hybrid of tabular and textual content in finance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.805430Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:b2f8df35152eb9c1393230deb353b28275053b22667ced75efe56e2a0184e118","observation_id":"9375986b-bb5d-496b-877a-9538da6d435b","resolution":{"observed_at":"2026-08-03T05:02:45.805430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:02:45.938777Z","title":"Benchmarking and improving large vision-language models for fundamental visual graph understanding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T05:02:45.938777Z"},"links":{"citing_paper":"/paper/2602.03491"},"observation_digest":"sha256:da87dfa5b5b5ba317f98bd323c76bbd1283294b06e8a5729f605ab06eab536ca","observation_id":"c7303acf-20b0-44d4-9af7-c6b1a28f91a7","resolution":{"observed_at":"2026-08-03T05:02:45.938777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.03491","last_updated":"2026-05-27T13:15:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:48:28.295254Z","submitted_at":"2026-02-03T13:08:31Z","title":"Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2602.03491."}