{"as_of":"2026-08-11T19:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3a9308c2d8f9d1fa937e7ad912771c24ccd7a74cecbec63983a4fa5f0efe554","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:32:54.293673Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:06:13.722238Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:04:21.532153Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":"2412.16243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-06-30T07:04:21.532153Z","title":"arXiv preprint arXiv:2412.16243 , year =","venue":null,"work_id":"aca3fb5f-5257-42c9-aea6-64dfd2b3a3b2","year":2024},"citing_paper":{"arxiv_id":"2602.20223","last_updated":"2026-04-09T07:40:01Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-23T13:37:44Z","title":"MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T20:11:22.146641Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2602.20223"},"observation_digest":"sha256:994e73930f85d36dd91c390124128314e9ee854424089ff3feb3fb5fb9b83ada","observation_id":"b6e713f0-8d1b-4438-a016-38e5aa82f808","resolution":{"observed_at":"2026-05-15T20:11:34.282727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":"2412.16243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-06-30T07:04:21.532153Z","title":"arXiv preprint arXiv:2412.16243 , year =","venue":null,"work_id":"aca3fb5f-5257-42c9-aea6-64dfd2b3a3b2","year":2024},"citing_paper":{"arxiv_id":"2605.08146","last_updated":"2026-05-26T13:04:47Z","snapshot_observed_at":"2026-08-11T13:52:57.867082Z","submitted_at":"2026-05-03T09:33:08Z","title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T01:31:52.536354Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2605.08146"},"observation_digest":"sha256:d82abd228fe4961920c26310f63d4ac5ef5eaffdc62611bc708cdad340323112","observation_id":"6399dd01-cfb0-4982-9ea6-b316869f8382","resolution":{"observed_at":"2026-05-12T07:56:27.032029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":"2412.16243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-06-30T07:04:21.532153Z","title":"arXiv preprint arXiv:2412.16243 , year =","venue":null,"work_id":"aca3fb5f-5257-42c9-aea6-64dfd2b3a3b2","year":2024},"citing_paper":{"arxiv_id":"2605.08146","last_updated":"2026-05-26T13:04:47Z","snapshot_observed_at":"2026-08-11T13:52:57.867082Z","submitted_at":"2026-05-03T09:33:08Z","title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-21T00:31:07.580063Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2605.08146"},"observation_digest":"sha256:31e4f860a752af6735ee6df40d415dc0f510631febb74b7c6d17cd79cab5f96f","observation_id":"29358c85-fa39-46ff-bc69-c403ceca74f2","resolution":{"observed_at":"2026-05-21T00:33:52.793869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":"2412.16243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-06-30T07:04:21.532153Z","title":"arXiv preprint arXiv:2412.16243 , year =","venue":null,"work_id":"aca3fb5f-5257-42c9-aea6-64dfd2b3a3b2","year":2024},"citing_paper":{"arxiv_id":"2605.10616","last_updated":"2026-05-11T14:12:05Z","snapshot_observed_at":"2026-08-02T09:44:08.889357Z","submitted_at":"2026-05-11T14:12:05Z","title":"MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T04:53:40.505699Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2605.10616"},"observation_digest":"sha256:2fdcc1a3248404d56b617cefcff9055431d5937ffdcb97ce0e02f1d88ffb732c","observation_id":"00bc0266-ace6-4ef3-9f9a-0f193817ce35","resolution":{"observed_at":"2026-05-12T05:51:24.761694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":"2412.16243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-06-30T07:04:21.532153Z","title":"arXiv preprint arXiv:2412.16243 , year =","venue":null,"work_id":"aca3fb5f-5257-42c9-aea6-64dfd2b3a3b2","year":2024},"citing_paper":{"arxiv_id":"2606.30410","last_updated":"2026-06-29T14:55:52Z","snapshot_observed_at":"2026-08-03T09:53:02.738738Z","submitted_at":"2026-06-29T14:55:52Z","title":"Beyond IID: How General Are Tabular Foundation Models, Really?","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:14.626274Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2606.30410"},"observation_digest":"sha256:c6a9dfc4006ad51d9b729d8adbec5b28551153737862422bca09f844243a24b3","observation_id":"4b6447a8-0f1d-4304-b2c6-a18ccbe7be48","resolution":{"observed_at":"2026-06-30T07:04:21.534599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16243","snapshot_observed_at":"2026-08-10T18:06:13.722238Z","title":"Bag of tricks for multimodal AutoML with image, text, and tabular data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06934","last_updated":"2026-08-07T08:07:06Z","snapshot_observed_at":"2026-08-11T18:11:04.157142Z","submitted_at":"2026-08-07T08:07:06Z","title":"Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:06:13.722238Z"},"links":{"cited_paper":"/paper/2412.16243","citing_paper":"/paper/2608.06934"},"observation_digest":"sha256:f58b773640b7fa7c27a12002fbf2b9df19a3280f3c70305215ff2a8d21ff0881","observation_id":"21d84596-18cd-4ae8-a670-159a501a9e44","resolution":{"observed_at":"2026-08-10T18:06:13.722238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16243/citation-record","integrity":"/paper/2412.16243/integrity","json":"/paper/2412.16243/citation-record.json","paper":"/paper/2412.16243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.729277Z","title":"Senior, Oriol Vinyals, and Andrew Zisserman","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.729277Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:5d4aa42a167ec12c243db161ec75067fb32a1400cb625b570ffb8de6f94da572","observation_id":"67d842ef-4644-450c-a933-3017b622cdb0","resolution":{"observed_at":"2026-08-11T11:32:53.729277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03828","last_updated":"2024-02-22T20:28:12Z","snapshot_observed_at":"2026-08-10T05:59:37.331093Z","submitted_at":"2023-06-06T16:15:26Z","title":"Quick-Tune: Quickly Learning Which Pretrained Model to Finetune and How","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03828","snapshot_observed_at":"2026-08-11T11:32:53.735768Z","title":"Quick-tune: Quickly learning which pretrained model to finetune and how","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.735768Z"},"links":{"cited_paper":"/paper/2306.03828","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:6096b83d464afe69a0f3bb90bac162661587eb8e87e397fa853aedfce3eb6c89","observation_id":"fa621a19-097a-42b2-b0bc-f7d7aa9d72b2","resolution":{"observed_at":"2026-08-11T11:32:53.735768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.741585Z","title":"Art in the age of machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.741585Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:ef0e3be8b915244b1868df0f068b08fe6ecc57e1ba48e3fb707b9b54d0792a43","observation_id":"796e6feb-ed8c-4558-9bae-aad63a5c8bc5","resolution":{"observed_at":"2026-08-11T11:32:53.741585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.747305Z","title":"Uncertainty-based traffic accident anticipation with spatio-temporal relational learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.747305Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:c27c908960b6ed84ce57e8866cb92ed3844d72acf8320da91100eba042aaedb7","observation_id":"2cdc397e-c7f4-4ab9-8378-9e9f754f1324","resolution":{"observed_at":"2026-08-11T11:32:53.747305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.752685Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.752685Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:2e603ace6cfece415709da6d5f30c87c8ebf30386a0d7aa643ad1ccf0cf1b03d","observation_id":"6ac38b33-5bfa-43b0-9537-428351661a96","resolution":{"observed_at":"2026-08-11T11:32:53.752685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.757862Z","title":"Early, intermediate and late fusion strategies for robust deep learning-based multimodal action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.757862Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:ff226e06e8e9f9d8cffa2446c9d18859072bbe91f9cfbfecf1b32a2a2380220c","observation_id":"68faa9b3-3334-4680-a07f-014e805b30bb","resolution":{"observed_at":"2026-08-11T11:32:53.757862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T11:32:53.763787Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.763787Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:647ca32000dc1449ec5fcba5a20e27e302318c255e8d513ba70b84ce5e42d036","observation_id":"e5134e87-08bb-4012-8cb3-cad72b608114","resolution":{"observed_at":"2026-08-11T11:32:53.763787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.769612Z","title":"Tabtext: A flexible and contextual approach to tabular data representation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.769612Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:2bd4bc8624a706c186dd00beaea3e3e7aa101d7ff3839ebb4b79d03e5a3bebc0","observation_id":"261fbf57-7a12-4d42-b9cc-730b8004458a","resolution":{"observed_at":"2026-08-11T11:32:53.769612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.775456Z","title":"Ensemble selection from libraries of models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.775456Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:c9adfd15fc5324415cc750ce78494634df62416807527365e4a6e98cd0939c0b","observation_id":"639cf92f-3417-4078-91e6-0cc5390ba52e","resolution":{"observed_at":"2026-08-11T11:32:53.775456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.780839Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.780839Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f743e191ab56961c4d91582107282cd246a6349753e9e685964541f55dad26c8","observation_id":"08b10916-2d2d-4195-a59f-a35ce9affb73","resolution":{"observed_at":"2026-08-11T11:32:53.780839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-11T11:32:53.787239Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.787239Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:632b9e3b49c06f7a912fc58b7acbc605b08d8e53c935c5da40cfc07088a5a64f","observation_id":"6f6068e2-8db0-4e4d-81cf-462599380cf7","resolution":{"observed_at":"2026-08-11T11:32:53.787239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11988","last_updated":"2020-12-14T18:52:43Z","snapshot_observed_at":"2026-07-06T09:31:14.331447Z","submitted_at":"2020-06-22T03:20:36Z","title":"COVID-19 Image Data Collection: Prospective Predictions Are the Future","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11988","snapshot_observed_at":"2026-08-11T11:32:53.794899Z","title":"Covid-19 image data collection: Prospective predictions are the future","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.794899Z"},"links":{"cited_paper":"/paper/2006.11988","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:e6105781292de9c36ba25354e847619ec0c61ec0312820e6fa9bc0e333cfda87","observation_id":"6e4057b8-71cb-4af2-b788-88f9995ecb70","resolution":{"observed_at":"2026-08-11T11:32:53.794899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.801417Z","title":"$i$-divergence geometry of probability distributions and minimization prob- lems","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.801417Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:2ba7bbf915662069b014dc3a3ed23634e4ecc2082ce8cf89e29f974b3008e287","observation_id":"2bd3f2b5-a282-4a05-8e8d-cd4106c2a0f1","resolution":{"observed_at":"2026-08-11T11:32:53.801417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09501","last_updated":"2019-04-11T22:39:27Z","snapshot_observed_at":"2026-08-03T21:58:34.348182Z","submitted_at":"2018-05-24T04:05:42Z","title":"AutoAugment: Learning Augmentation Policies from Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09501","snapshot_observed_at":"2026-08-11T11:32:53.807106Z","title":"Autoaugment: Learning augmentation policies from data","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.807106Z"},"links":{"cited_paper":"/paper/1805.09501","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d75ac6e6d3aaf40f95339005588d994ae55411186414b76dd332532e52a4a619","observation_id":"10573258-6ad3-4072-88e8-dcc3d30b8a3c","resolution":{"observed_at":"2026-08-11T11:32:53.807106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.812451Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.812451Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:aa08fa179e31a6517cc17fc52e2ecc17d6c237f64a89042506ce9af3a9f9d660","observation_id":"994d3633-e8ef-45ff-b5de-d26f8e89bff3","resolution":{"observed_at":"2026-08-11T11:32:53.812451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.817344Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.817344Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:cdde330b4aa125df42ef81ade34cba937fe4feeea69d338909cb844fbea64cc6","observation_id":"fc36ce0b-0ec8-4ea7-802b-16d433a06cf6","resolution":{"observed_at":"2026-08-11T11:32:53.817344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.822469Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.822469Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:5f68def4d4ab41a8134c5f73484dcf174872ffcf7458268ae5ed4aa6d2239eaf","observation_id":"107e1337-f748-4dd8-91ba-83a8a219a578","resolution":{"observed_at":"2026-08-11T11:32:53.822469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09284","last_updated":"2021-04-25T05:00:53Z","snapshot_observed_at":"2026-07-06T11:10:58.497688Z","submitted_at":"2021-04-25T05:00:53Z","title":"SemEval-2021 Task 6: Detection of Persuasion Techniques in Texts and Images","version":1},"cited_work":{"arxiv_id":"2105.09284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.09284","snapshot_observed_at":"2026-08-11T11:32:55.200917Z","title":"SemEval-2021 Task 6: Detection of Persuasion Techniques in Texts and Images","venue":"cs.MM","work_id":"f0e754f9-8c65-4915-ba98-bbf3ad1be7f2","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.827522Z"},"links":{"cited_paper":"/paper/2105.09284","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d3f309c0b817a7983336bda8a1e6449f188719bc501e08d7b1fb153514fbc4f1","observation_id":"08d0cb6e-818c-426e-9856-3cc61f89ce63","resolution":{"observed_at":"2026-08-11T11:32:55.207323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T11:32:53.832998Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.832998Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:cd796a141fdcd9a2fb65a29f28a0cfcf504b1c1e68a50c0d241bf36b3a5995c2","observation_id":"dda2cfd4-5709-4bda-a4b2-1c58387f658f","resolution":{"observed_at":"2026-08-11T11:32:53.832998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06505","last_updated":"2020-03-13T23:10:39Z","snapshot_observed_at":"2026-08-11T01:55:19.859576Z","submitted_at":"2020-03-13T23:10:39Z","title":"AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06505","snapshot_observed_at":"2026-08-11T11:32:53.838261Z","title":"Autogluon-tabular: Robust and accurate automl for structured data","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.838261Z"},"links":{"cited_paper":"/paper/2003.06505","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:0c0ce124aa77289a58f3cb37e94b87ee988b5dce98800692dda2056a15362b58","observation_id":"e85e74e6-4df9-4912-aebc-d38fb41a60b3","resolution":{"observed_at":"2026-08-11T11:32:53.838261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.843828Z","title":"A proactive intelligent decision support system for predicting the popularity of online news","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.843828Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:ba9fcd95485e0ff6c258c55d82ca0ca1730498d9a341db04412542466cc07c8e","observation_id":"e3b9aa09-e9ad-491c-ba5d-8f52d347f6a7","resolution":{"observed_at":"2026-08-11T11:32:53.843828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.849059Z","title":"Hyperparameter optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.849059Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:9716eb939a1494a8624e803f232c03b2af1cf9201dec523cf91c4414964c6212","observation_id":"efef5def-4c62-45aa-8122-98afc3a33efb","resolution":{"observed_at":"2026-08-11T11:32:53.849059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.854056Z","title":"Auto-sklearn 2.0: Hands-free automl via meta-learning.Journal of Machine Learning Research, 23(261):1–61, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.854056Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:7d77f60bd61006d08f43a9c13bd5906f0150c5e2d126031e1b52d138f9feab26","observation_id":"cea9fda4-fa6d-4f5e-97c9-8e62663a80df","resolution":{"observed_at":"2026-08-11T11:32:53.854056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T11:32:53.859092Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.859092Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:74bcc0ad43ffdfa5570ebb946d8254d960f01fa4c53c2b5c7f7a5e73d7eecc4e","observation_id":"5411be2e-c825-4770-bab6-6ddc56c57bca","resolution":{"observed_at":"2026-08-11T11:32:53.859092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.870129Z","title":"Early vs late fusion in multimodal convolutional neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.870129Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:59edff053c16799afccb0626ba5660c6b0c2f96db6d67ff50f64c1ad92490815","observation_id":"24a3c495-e393-4ddf-9ed2-1ce71bfd0157","resolution":{"observed_at":"2026-08-11T11:32:53.870129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.875485Z","title":"What action causes this? towards naive physical action-effect prediction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.875485Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f4e81db83716fd74a8c55ab9b3a98d034cae3fb0b5bfc5ae2f1b35a0b16343ea","observation_id":"e7cc3988-3a1d-437b-8cfb-3242639b6d42","resolution":{"observed_at":"2026-08-11T11:32:53.875485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12560","last_updated":"2023-11-16T14:12:10Z","snapshot_observed_at":"2026-08-05T19:50:36.254635Z","submitted_at":"2022-07-25T22:34:08Z","title":"AMLB: an AutoML Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12560","snapshot_observed_at":"2026-08-11T11:32:53.880682Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.880682Z"},"links":{"cited_paper":"/paper/2207.12560","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:e953e7ce962a1bcf2ba55901b099fedd7fa2bef61f5fd2651b70768073fb6665","observation_id":"929e744e-1ffc-490f-92db-ff55a189093a","resolution":{"observed_at":"2026-08-11T11:32:53.880682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.885810Z","title":"Revisiting deep learning models for tabular data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.885810Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:22dd904440017314549bb37720e813534bbaa3cdf666791831b067d0d3314cad","observation_id":"654a076e-013a-469c-be28-ec2cf48e79b6","resolution":{"observed_at":"2026-08-11T11:32:53.885810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.891371Z","title":"A guide to machine learning for biologists","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.891371Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:5b5b4273c20161bc33db0a92201d033b6f18a233a853393b89edef891ec0ec0b","observation_id":"a56bc0bd-83a6-4004-b398-b85026cabf8b","resolution":{"observed_at":"2026-08-11T11:32:53.891371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-11T18:22:44.663774Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-11T11:32:53.896453Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.896453Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:a14ce88c3805a62e45bb5ec2d94e8980105c82c69f09c32e1e9b2ab72f86d6b7","observation_id":"c358b2fe-91e0-491c-813c-ad7ee58906dc","resolution":{"observed_at":"2026-08-11T11:32:53.896453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.902232Z","title":"Sentiment analysis on large scale amazon product reviews","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.902232Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d0a539a8eda5802e744c9a8da319ab037e110b3ca61422d4531c9a91b7c1852c","observation_id":"9348615c-d4a7-45e8-ad48-a75712c79e55","resolution":{"observed_at":"2026-08-11T11:32:53.902232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.907403Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.907403Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f9e1dc0a327cbd094fa1cd825ccd05d363049c3563e46e038ae07314e7593667","observation_id":"70554112-5a8f-4173-82ad-064afb51c429","resolution":{"observed_at":"2026-08-11T11:32:53.907403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09543","last_updated":"2023-03-24T09:17:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-18T06:48:00Z","title":"DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09543","snapshot_observed_at":"2026-08-11T11:32:53.913271Z","title":"Debertav3: Improving deberta using electra-style pre-training with gradient-disentangled embedding sharing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.913271Z"},"links":{"cited_paper":"/paper/2111.09543","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:bdc331082b7cc61072f1aa0268d4e457f99abc1e04e01054a99665f81c762d6f","observation_id":"4791f039-b7cf-41fd-9e0b-66ba546c24b2","resolution":{"observed_at":"2026-08-11T11:32:53.913271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.919660Z","title":"Bag of tricks for image classification with convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.919660Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:71188a269541efdbdb2cb4689dc781607f52d7a5c18d10850a6f7581a04c0bf3","observation_id":"1cfb0f30-edc9-46ec-91b2-cb6e7f465234","resolution":{"observed_at":"2026-08-11T11:32:53.919660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.925446Z","title":"Tabllm: Few-shot classification of tabular data with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.925446Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:25a1940f4fdf20e9eac782453f15432bfd7f08f313e2b8dc98235a6f60d2ee84","observation_id":"441fd696-f34b-40e0-b510-ccf488512814","resolution":{"observed_at":"2026-08-11T11:32:53.925446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.931348Z","title":"Dvm-car: A large-scale automotive dataset for visual marketing research and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.931348Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:a7ffe6dc43b4b19e8ddae43bd7b235d456e32604847f020c309e28ceab4ab31f","observation_id":"572237be-d431-45e7-a86c-7a4785c04341","resolution":{"observed_at":"2026-08-11T11:32:53.931348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.936478Z","title":"Applying machine learning techniques to transporta- tion mode recognition using mobile phone sensor data","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.936478Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d2a3c5d72df61cb7a5bfa4c7d86167ed716006db51fe22a88ed2873ce6fbb94d","observation_id":"59770186-8cc4-4a38-a2a4-2cec6603a478","resolution":{"observed_at":"2026-08-11T11:32:53.936478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12464","last_updated":"2023-12-21T02:43:26Z","snapshot_observed_at":"2026-07-06T17:05:31.586924Z","submitted_at":"2023-12-18T21:11:17Z","title":"Towards Better Serialization of Tabular Data for Few-shot Classification with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12464","snapshot_observed_at":"2026-08-11T11:32:53.941791Z","title":"Towards better serializa- tion of tabular data for few-shot classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.941791Z"},"links":{"cited_paper":"/paper/2312.12464","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:24861ed03a331551b8303203ddc7fdd7bf6410429aca61d7dbc96152c5a66820","observation_id":"030607af-e0c7-49d8-8746-c13cec929aac","resolution":{"observed_at":"2026-08-11T11:32:53.941791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.947686Z","title":"Machine Learning in Chemistry, volume 1","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.947686Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:3b732e0bcb44101eab7270dea8b6b19572658df5e906a10cb141a56c22afc7ee","observation_id":"51e11593-2879-4a2c-a595-5668c71a743b","resolution":{"observed_at":"2026-08-11T11:32:53.947686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.953112Z","title":"Autokeras: An automl library for deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.953112Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:30f35c2f5ef0e5c4ed590a4b2ff50229fa41734f15ac91b0ff176a676687c48a","observation_id":"98315d83-630a-4c37-888b-05ddf8b984a9","resolution":{"observed_at":"2026-08-11T11:32:53.953112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-11T11:32:53.958917Z","title":"Bag of tricks for efficient text classification","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.958917Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:53567263ca7429883a164e85667d1d1e5a488f6ce78ec9c02aa5dbab0421c79c","observation_id":"f462f4e1-5087-4532-a407-7317e84d7d4c","resolution":{"observed_at":"2026-08-11T11:32:53.958917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.964505Z","title":"Rossi, and Andrea Prati","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.964505Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:fc80c96e97b077ee9ccd142e19f283dd4b4429f033f02e1f2504838ed3e80d0b","observation_id":"9cbfae1c-e978-465a-95ea-b3c9d6e185fc","resolution":{"observed_at":"2026-08-11T11:32:53.964505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.975317Z","title":"Mahadi Hassan, Micah J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.975317Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:127d574163679f0809c914953f3dbdf4ae0bb49084174888dbe1807ab2260726","observation_id":"79a387ed-5b79-4489-972f-6f9dc9fce65a","resolution":{"observed_at":"2026-08-11T11:32:53.975317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:53.980242Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.980242Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:e09b43cdfa04b4864d018fd6dfdfa921905877a0ba26da3aae2de92c00693ef1","observation_id":"dc43b165-7fcf-4b1c-8111-c927583710a4","resolution":{"observed_at":"2026-08-11T11:32:53.980242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.099488Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"032c1510-3d81-4581-b067-995f7a632515","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.985788Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:cffe55990a3566c05554bc82410447bb79547172b57aaf9a5d96e15979ae63ba","observation_id":"ddf48736-824f-48c8-b42f-6d2abcb18ed6","resolution":{"observed_at":"2026-08-11T11:32:56.104970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.082609Z","title":"H2o automl: Scalable automatic machine learning","venue":null,"work_id":"6b175256-c4e0-4eaf-856c-4ad84d0727cd","year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.991660Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:779eaa3d1f5022ee9d63ce751e5bb45873b53e916e6c4605857929a2ae437878","observation_id":"b25d6c8e-8384-4f28-b9f7-c77fb70506cb","resolution":{"observed_at":"2026-08-11T11:32:56.088320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.063998Z","title":"Multimodal prompting with missing modalities for visual recognition","venue":null,"work_id":"b1399c39-5944-44b2-a4c2-90359e0bb039","year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:53.996580Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:9bb490b1c5693ad9fc924d7f4c440ae5f9344384cb626003e7021227340517d5","observation_id":"2ec83341-e1bc-4951-b5a6-055ef5438e23","resolution":{"observed_at":"2026-08-11T11:32:56.070154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T11:32:54.003009Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.003009Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:1d7a7718b6467c0adaa17fae7be07532965013ae356daf8393f09bbdc8bc9a5e","observation_id":"271afd3b-3f5f-406f-96f3-c1ecae1b1f7d","resolution":{"observed_at":"2026-08-11T11:32:54.003009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.045771Z","title":null,"venue":null,"work_id":"649fcac4-09a1-4c7b-8a39-f9f7eb658aae","year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.008434Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:da122e2954a1fb5253e5344d9c82a76eb7ced582af9da6043933ea9aa5bcb932","observation_id":"4a5128ce-3d2a-4511-9d15-4302682e67b7","resolution":{"observed_at":"2026-08-11T11:32:56.051239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.028093Z","title":"Multibench: Multiscale benchmarks for multimodal representation learning","venue":null,"work_id":"3d1cdb86-788f-4c0c-832b-ca0d80abae07","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.013513Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:1353edcbd5b58d28d7ac9a6d9dbbb5c1b6b4ded7342f3b4cb1961e3e6b09a444","observation_id":"deda5ee4-6a59-44db-96c1-8c8bb0e338a0","resolution":{"observed_at":"2026-08-11T11:32:56.033366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:56.011221Z","title":"Fast autoaugment","venue":null,"work_id":"47830878-1642-4a0c-bea3-d02981e8aa74","year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.018478Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:4718204f35396d0434f44b898815480de8e639c902c2354a16a5a150eea5ff97","observation_id":"0ec7acda-1f63-48f5-b00a-c86774732196","resolution":{"observed_at":"2026-08-11T11:32:56.016345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.993449Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":"ca4fc824-e2cb-4335-a589-b29931b8049b","year":2014},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.023833Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:7baa841a0f3c1cc3063064aa65c2f244dbcde2c8871f791eeadbeab4336bd0a4","observation_id":"e28bb484-2452-4c26-8b40-7a327ba5c2d5","resolution":{"observed_at":"2026-08-11T11:32:55.999214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.976677Z","title":"Vision transform- ers are parameter-efficient audio-visual learners","venue":null,"work_id":"83e071a7-c092-48e9-8dbb-3d2ac1d7192a","year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.029096Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f52f7d7d4f98a01cc27f5159b64a6ba9a61a15b6085024d2ee8c163903461d9d","observation_id":"585227d6-5c14-4124-bfa9-f23e629a0a83","resolution":{"observed_at":"2026-08-11T11:32:55.982049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T11:32:54.034142Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.034142Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:95175f8137a91a470d61168693fa48c99d6853285f619c47e45afde2dec348d5","observation_id":"37266650-531e-4b8a-be8b-ff733551f224","resolution":{"observed_at":"2026-08-11T11:32:54.034142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-11T14:56:04.364712Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-11T11:32:54.039495Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.039495Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d160d305e68a19790bf54ca0b0ba55430997519bc746611d9ab514dab9387114","observation_id":"7aa1e192-1da6-423c-b252-6cab0852ad95","resolution":{"observed_at":"2026-08-11T11:32:54.039495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T11:32:54.052111Z","title":"Mmbench: Is your multi-modal model an all-around player? ArXiv, abs/2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.052111Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:fd97dcc3ec66dcbcc1ee54da48a0b34aea7c60c2c328e52170a167e2069746f1","observation_id":"56a2b851-9c1b-437a-a02c-5aced993e8b5","resolution":{"observed_at":"2026-08-11T11:32:54.052111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.057243Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.057243Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:1bd0db64e2ef57fd6bc529a40b926fe0ef9fb993523aeb2e9218d3f00549e7a3","observation_id":"dfd47099-105e-46b3-94ac-6c8a6375be11","resolution":{"observed_at":"2026-08-11T11:32:54.057243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14453","last_updated":"2023-04-24T14:48:00Z","snapshot_observed_at":"2026-07-06T14:35:57.506538Z","submitted_at":"2022-12-29T20:39:36Z","title":"Learning Multimodal Data Augmentation in Feature Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14453","snapshot_observed_at":"2026-08-11T11:32:54.062603Z","title":"Learning multimodal data augmentation in feature space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.062603Z"},"links":{"cited_paper":"/paper/2212.14453","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:d4310aad781e3484f6355a99f14be108e7412ac91eedfa1f6c297c83f7bd7bdd","observation_id":"79e8b68c-ef02-43fb-be46-293d1a820abc","resolution":{"observed_at":"2026-08-11T11:32:54.062603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T11:32:54.067936Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.067936Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:dfaf9c527522f6fc68d48e8bff3b8a47c0f8e03e940812705e4ae34e290a7696","observation_id":"26c2029f-2f25-4f5b-bb76-26b98f44cdc0","resolution":{"observed_at":"2026-08-11T11:32:54.067936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.931352Z","title":"Smil: Multimodal learning with severely missing modality","venue":null,"work_id":"5b8b9090-560d-40fb-a1f3-0c1ad8f7e1be","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.073433Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:94816c3354cf0ade686626512f20456048ea16544a9dd0947f44f5657357ac50","observation_id":"7f8f8ba0-9599-4b01-abe9-0da5ebd20e8c","resolution":{"observed_at":"2026-08-11T11:32:55.936691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-11T11:32:54.078179Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.078179Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:8565e26f9408978e17aedace23fd1ce42df7d81c07479caa7f173b551f309244","observation_id":"c26947db-c972-4a7b-8bd9-bba1b4d49332","resolution":{"observed_at":"2026-08-11T11:32:54.078179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.913726Z","title":"Trivialaugment: Tuning-free yet state-of-the-art data augmentation","venue":null,"work_id":"a8571f65-338d-4f02-b90e-be36d78accb3","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.084871Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:0307bb16fa249722bb1ba3a3805771c456d8857116ef0741e214b65e5f3251cc","observation_id":"8efadf71-34c8-4298-b635-abf46843c521","resolution":{"observed_at":"2026-08-11T11:32:55.919148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03854","last_updated":"2020-03-12T17:55:57Z","snapshot_observed_at":"2026-08-10T13:24:36.927385Z","submitted_at":"2019-11-10T05:06:38Z","title":"r/Fakeddit: A New Multimodal Benchmark Dataset for Fine-grained Fake News Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03854","snapshot_observed_at":"2026-08-11T11:32:54.090692Z","title":"r/fakeddit: A new multimodal benchmark dataset for fine-grained fake news detection","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.090692Z"},"links":{"cited_paper":"/paper/1911.03854","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:085f2c5f13bc9d2dda2fc1124a11b987ca7e733814c58f479666bf75c247dfbd","observation_id":"b2c5897c-e8b7-4baf-81ce-739119bfb311","resolution":{"observed_at":"2026-08-11T11:32:54.090692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.896182Z","title":"Semi-supervised tabular classification via in-context learning of large language models","venue":null,"work_id":"be7e985d-4321-42f0-a3ee-b2711c36c944","year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.097973Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:7d2873429d89b03606553f0ef144e5121a075921f319056c70361ab63516d8b8","observation_id":"9323a766-8b24-496e-ac91-380f5bbf5002","resolution":{"observed_at":"2026-08-11T11:32:55.901583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.878216Z","title":"Multimodal deep learning","venue":null,"work_id":"9b9eb61a-b5e4-470a-9e6d-2a2914958704","year":2011},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.103575Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:b689fb3f52614b5bfa62ba9d2437a9f384e902cbc5c0ef8d5d97dd39b716a763","observation_id":"b082bfb7-cdfe-4921-b872-fb86677304fb","resolution":{"observed_at":"2026-08-11T11:32:55.884015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.859386Z","title":"Tpot: A tree-based pipeline optimization tool for automating machine learning","venue":null,"work_id":"19105c71-0a64-4817-bbc0-335a9028863d","year":2016},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.109153Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:db2d6db14b44e8d4bd5c0342d588768bd9177173df386aafae2e5caf84cbb593","observation_id":"7e50974e-33e7-4f61-b1f2-a73e4663d1ff","resolution":{"observed_at":"2026-08-11T11:32:55.865224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.114269Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.114269Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:844b2254b4df010b53f4e4687edc057e4dc67ea31c957cad45ad9cdb88876018","observation_id":"c9786abe-57ed-4d41-8cd5-e0d85312686f","resolution":{"observed_at":"2026-08-11T11:32:54.114269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.833613Z","title":"Multilayer perceptron and neural networks","venue":null,"work_id":"bd9dcd83-a759-46b7-922d-ca7e276d9b88","year":2009},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.119837Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:85432eac62b49ac550f8040ae993475556af54c12f4b3b3be668c949d8138989","observation_id":"b68da2f9-4f2f-4fef-8da4-7848d5e8c87a","resolution":{"observed_at":"2026-08-11T11:32:55.838768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.124835Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.124835Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:91a6a2cdc0fe30c974416f28e2a0c368d1d6cb2728b26dec1a9267290edd114f","observation_id":"60220fcd-2b6a-4261-be0b-f6d51dec496f","resolution":{"observed_at":"2026-08-11T11:32:54.124835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12808","last_updated":"2020-11-11T00:59:17Z","snapshot_observed_at":"2026-07-06T07:18:14.810715Z","submitted_at":"2018-11-13T15:36:42Z","title":"Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12808","snapshot_observed_at":"2026-08-11T11:32:54.131911Z","title":"Model evaluation, model selection, and algorithm selection in machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.131911Z"},"links":{"cited_paper":"/paper/1811.12808","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:5a548a26b6c223e741de8c18005374fac98743604ec35ecd2d71c8dddb44f802","observation_id":"3a9eb3e5-bf09-47f5-acc2-aecaf7604190","resolution":{"observed_at":"2026-08-11T11:32:54.131911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.806594Z","title":"Bernstein, Alexander C","venue":null,"work_id":"4d6db797-08df-4b54-969f-1736c8217167","year":2014},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.137634Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:77861a511701a56128deb442c2c3ab472ea1c1a6c348138b0482853db593891d","observation_id":"61420598-30c3-455f-b2b3-f912904c12c7","resolution":{"observed_at":"2026-08-11T11:32:55.811599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.790080Z","title":null,"venue":null,"work_id":"ee619805-5cd3-4800-b1f2-a910beb03b34","year":2020},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.143174Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f3d60aacc33aea9799e1d0da3fb4871e20f42ac344ce60a8f651cb9532687994","observation_id":"afa69c84-fb28-4318-8aa3-fa192635ca25","resolution":{"observed_at":"2026-08-11T11:32:55.795175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02705","last_updated":"2021-11-04T09:29:16Z","snapshot_observed_at":"2026-08-05T03:09:36.676057Z","submitted_at":"2021-11-04T09:29:16Z","title":"Benchmarking Multimodal AutoML for Tabular Data with Text Fields","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02705","snapshot_observed_at":"2026-08-11T11:32:54.148693Z","title":"Benchmarking multimodal automl for tabular data with text fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.148693Z"},"links":{"cited_paper":"/paper/2111.02705","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:6d8bc0e2374087e8d6480565eaea409472b914184671c4edfd74877579dac277","observation_id":"30cc74c4-34ff-4afa-9585-f323e6ea1eee","resolution":{"observed_at":"2026-08-11T11:32:54.148693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.154110Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.154110Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:f4e5908bb5fbef0e1839d61539b711f8fffc035ea8bfec07305aee53a7ea4f1d","observation_id":"796e88c0-b2c9-4d74-a3fd-c37aac1266e1","resolution":{"observed_at":"2026-08-11T11:32:54.154110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.762297Z","title":"Multimodn—multimodal, multi-task, interpretable modular networks","venue":null,"work_id":"0c604869-ea6a-4afb-b93f-668513e9a1e3","year":2024},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.159270Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:bccd335dff5676e479c220b7223a08af59e3a0c8d35169d75e6fc15f0fb880d8","observation_id":"527bbdbf-a639-4432-bb44-614a9be96d56","resolution":{"observed_at":"2026-08-11T11:32:55.767564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16233","last_updated":"2024-04-30T21:09:27Z","snapshot_observed_at":"2026-08-09T12:08:52.225929Z","submitted_at":"2024-04-24T22:28:12Z","title":"AutoGluon-Multimodal (AutoMM): Supercharging Multimodal AutoML with Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16233","snapshot_observed_at":"2026-08-11T11:32:54.164295Z","title":"Autogluon-multimodal (automm): Supercharging multimodal automl with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.164295Z"},"links":{"cited_paper":"/paper/2404.16233","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:7f1f506926a34db7d5c0679fc7b833fecdc50ec21d8358c74ba9b69b29300001","observation_id":"6d52952a-7330-4820-a7fa-430aa8bfc1eb","resolution":{"observed_at":"2026-08-11T11:32:54.164295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08107","last_updated":"2024-02-21T11:18:20Z","snapshot_observed_at":"2026-07-06T15:42:14.659345Z","submitted_at":"2023-06-13T19:51:22Z","title":"AutoML in the Age of Large Language Models: Current Challenges, Future Opportunities and Risks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08107","snapshot_observed_at":"2026-08-11T11:32:54.169690Z","title":"Automl in the age of large language models: Current challenges, future opportunities and risks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.169690Z"},"links":{"cited_paper":"/paper/2306.08107","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:e7fe257008fac22679d1d03978ab59b94a3fc374d32ec9fef06397c152692d4b","observation_id":"255c333a-f098-4e15-a126-f3ec3ea03cb4","resolution":{"observed_at":"2026-08-11T11:32:54.169690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T11:32:54.175116Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.175116Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:0b91f4742ec2f5d726f69d483c7ebc8efca3a44a0ea05ebec3c523720bb19149","observation_id":"0f7f1934-d4c1-4d23-b167-aae898e807e5","resolution":{"observed_at":"2026-08-11T11:32:54.175116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.180398Z","title":"The HAM10000 dataset, a large collection of multi-source dermatoscopic images of common pigmented skin lesions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.180398Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:2df0f392122ae5e2bff274066cdc335f4d7a56d5031974dd6a2d97881255467e","observation_id":"ede8473f-9502-4db0-ae32-a8c68f265e81","resolution":{"observed_at":"2026-08-11T11:32:54.180398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.745566Z","title":"The ham10000 dataset, a large collection of multi-source dermatoscopic images of common pigmented skin lesions","venue":null,"work_id":"0e81d5c8-46ca-4185-af78-23e125060d61","year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.185609Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:aaff52eda04a0b3b3ecf963d9d1fb96e879a726b8acc51f3b4e670ac79d9e136","observation_id":"3c38ca31-a9ec-4f8a-a921-5420df5e9c55","resolution":{"observed_at":"2026-08-11T11:32:55.751058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01528","last_updated":"2022-04-05T13:45:00Z","snapshot_observed_at":"2026-08-09T13:14:55.508289Z","submitted_at":"2021-09-03T13:52:32Z","title":"LightAutoML: AutoML Solution for a Large Financial Services Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01528","snapshot_observed_at":"2026-08-11T11:32:54.191128Z","title":"Lightautoml: Automl solution for a large financial services ecosystem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.191128Z"},"links":{"cited_paper":"/paper/2109.01528","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:78f94aca9af4e2b14c70ac9088960cc2127d451c6d5df91945f04517b4e707dd","observation_id":"585a7c11-03a1-46b2-92cd-a34c31516f0e","resolution":{"observed_at":"2026-08-11T11:32:54.191128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T11:32:54.196481Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.196481Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:ed4c02830262daab15b6b52fdd8497fac0721aff015d7cc7c911bc6b43610d22","observation_id":"f8260554-b9d8-462e-a3b1-863d3c0c0140","resolution":{"observed_at":"2026-08-11T11:32:54.196481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1407.7722","last_updated":"2014-08-01T13:03:28Z","snapshot_observed_at":"2026-08-05T13:31:22.932589Z","submitted_at":"2014-07-29T13:32:44Z","title":"OpenML: networked science in machine learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1407.7722","snapshot_observed_at":"2026-08-11T11:32:54.201937Z","title":"van Rijn, B","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.201937Z"},"links":{"cited_paper":"/paper/1407.7722","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:1ab2ed4e663f690c9cb93e62468c1b5bd258a44f72bf6127a8d5f61b9e4179d1","observation_id":"712d444a-50f7-4db1-95af-27b7408d5386","resolution":{"observed_at":"2026-08-11T11:32:54.201937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.727139Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"3176b1ae-d65a-4d17-ab5d-17c048e6eee2","year":2017},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.207248Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:95a28c716dbf016de3921ebe230b8ec4b1cfacb2fe3d96ef1d37646c2fe13442","observation_id":"f11a5bf0-0640-446a-bed1-b3a1124db26e","resolution":{"observed_at":"2026-08-11T11:32:55.733102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.706130Z","title":"Manifold mixup: Better representations by interpolating hidden states","venue":null,"work_id":"d6b65193-1511-47a0-8e20-06e948993b58","year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.213047Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:3433144f52df8070b70a8d6065a55d5a2d9d87780ae22d0b1b37f47bd2138b2d","observation_id":"0715accd-0f47-4d56-a582-6a5e594fde6d","resolution":{"observed_at":"2026-08-11T11:32:55.711628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.686243Z","title":"Automatic detection of online recruitment frauds: Characteristics, methods, and a public dataset","venue":null,"work_id":"15d4460c-e790-49b0-a3e3-c001405245f6","year":2017},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.218161Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:651e26f4be14a3aa46311c6710cc95f6f6dc64c45e984644c935f79296c4c3dd","observation_id":"ac76f888-fb12-4530-8bed-05c872d5377b","resolution":{"observed_at":"2026-08-11T11:32:55.692020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.669674Z","title":"Centralnet: a multilayer approach for multimodal fusion","venue":null,"work_id":"554b2f18-de1f-4641-a196-0d8f1e111a75","year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.223786Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:6d811997cbb0b1caeef04c8a9ba039d716a1ddfe8af985ccf1bd1b1e4b8d355e","observation_id":"7e4edae6-b118-4521-b85a-282f83dd03f4","resolution":{"observed_at":"2026-08-11T11:32:55.674908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.652970Z","title":null,"venue":null,"work_id":"672700e7-8aa9-411e-ae11-db950ea2dbe2","year":2018},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.228696Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:1ba6ce2137366250e755907ac030ac5b34bdffdcd976a306ccf39c2448d6daf3","observation_id":"0f3d1875-ce97-4a26-b41d-489c9ccd8c42","resolution":{"observed_at":"2026-08-11T11:32:55.658299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-11T11:32:54.233928Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.233928Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:c7cdb05ae7d74b38fe2a9bfbdd96827bcd79c16872a337e6dc9dc249762a1517","observation_id":"ace94817-0a93-4073-aa95-68f5d2b0a76e","resolution":{"observed_at":"2026-08-11T11:32:54.233928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.634827Z","title":"Flaml: A fast and lightweight automl library","venue":null,"work_id":"709bfb61-76cf-492d-8902-692a04dcf1e1","year":2021},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.239900Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:856709cf5f50e6d24f2cb9265e0dffa3fd6bccf27e87eee843f2178e6c6ab7b6","observation_id":"74ae649d-ff34-4877-ab3c-95881b555331","resolution":{"observed_at":"2026-08-11T11:32:55.640204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03266","last_updated":"2024-01-16T20:15:18Z","snapshot_observed_at":"2026-08-10T16:27:24.440215Z","submitted_at":"2023-10-05T02:37:09Z","title":"UniPredict: Large Language Models are Universal Tabular Classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03266","snapshot_observed_at":"2026-08-11T11:32:54.245525Z","title":"Unipredict: Large language models are universal tabular predictors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.245525Z"},"links":{"cited_paper":"/paper/2310.03266","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:97d07eb4e5c9b434e6af8ce3efe1544d6682b393a56501788f0617ba68b72679","observation_id":"823b05fb-60fd-4a96-b2ea-fa4c1c2057ff","resolution":{"observed_at":"2026-08-11T11:32:54.245525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-10T16:55:05.317569Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-11T11:32:54.251128Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.251128Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:bb62cf05d0130104d76c22b66692086b457a22510d2e6fba0c1cb6def923b265","observation_id":"dff76f85-c99a-4b7b-89d1-ff3a9da7a068","resolution":{"observed_at":"2026-08-11T11:32:54.251128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:54.256764Z","title":"Pytorch image models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.256764Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:cd635458ad1b623b746d26d8fca32b37789f767ad37460bb01705ebbe55d0852","observation_id":"fc6a3702-0d37-4ac9-96b1-299a9a450e69","resolution":{"observed_at":"2026-08-11T11:32:54.256764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.604801Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"4ee2f61e-9ec0-4602-999e-8e86514bff26","year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.261783Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:ee2386152a288e09bdfe27733e93fac2472b17bbc4805f05bfcff1be63951d76","observation_id":"9cd66b8d-e55f-4ad0-9d70-6c1bc22063a6","resolution":{"observed_at":"2026-08-11T11:32:55.610663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.586805Z","title":null,"venue":null,"work_id":"496e85fc-2b9c-4a1d-8c95-317cc57d1447","year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.266742Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:3226c7d1b318ec713beca099e175675c3edc422fff3ea5deaf6f7acca0271d46","observation_id":"2bd0a838-74df-4f3a-97b9-e8b6ec3a47d4","resolution":{"observed_at":"2026-08-11T11:32:55.592075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.566990Z","title":"Modality-specific learning rates for effective multimodal additive late-fusion","venue":null,"work_id":"50f4e67f-0201-4272-bb99-3a9e87b8b518","year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.271625Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:8f05afe0d864f8aaaabf18b7e80696c0b2a31be6c1087e8234676a89a3010451","observation_id":"cc1e4a2e-145e-4686-a669-858c533dc5fb","resolution":{"observed_at":"2026-08-11T11:32:55.572710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T11:32:54.276444Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.276444Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:a07b61cdde08c80cc5ada019574fb5da3fb0cc4690b044c25804c7e18f5f0476","observation_id":"e02c73f7-eac5-4339-9233-c29527ee0c01","resolution":{"observed_at":"2026-08-11T11:32:54.276444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T11:32:54.281677Z","title":"Mm-vet: Evaluating large multimodal models for integrated ca- pabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.281677Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:87c4403c3caa5e9d33fb004a085426c879848931473fe8ad37d7cd44ea62da17","observation_id":"131f44ec-93a9-4417-9cbf-e1adc4b5fe32","resolution":{"observed_at":"2026-08-11T11:32:54.281677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.546168Z","title":"Multimodal price prediction","venue":null,"work_id":"6eee09fb-79c2-41bd-a484-0b339031a521","year":2023},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.287952Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:c1b869764ccbe2e23f6cc1420899891739bbc4fc672b5a1d036e6a4bf00f3377","observation_id":"0ec59c4d-2848-4d1e-a12b-5036f0d31582","resolution":{"observed_at":"2026-08-11T11:32:55.552999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:32:55.525054Z","title":"Tag-assisted multimodal sentiment analysis under uncertain missing modalities","venue":null,"work_id":"3992b7b0-0bb3-48c9-9dc8-f6b3a9ef8756","year":2022},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.293673Z"},"links":{"citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:daa149d1280c5cf501affbbf47b231d74539be28440a89fc72a9c4fe77e3e7a2","observation_id":"58a44710-f7a3-463e-a462-bb0dac6f9fa3","resolution":{"observed_at":"2026-08-11T11:32:55.531118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T14:57:24.479167Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 6 inbound Pith citation observations for arXiv:2412.16243."}