{"as_of":"2026-08-17T21:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76fff0b1fab10ae238db46a5f0723a37e27fd79c3136b559f503cd74478aa831","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:22:35.455720Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02858/citation-record","integrity":"/paper/2505.02858/integrity","json":"/paper/2505.02858/citation-record.json","paper":"/paper/2505.02858"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.03194","last_updated":"2024-10-03T00:32:22Z","snapshot_observed_at":"2026-08-17T10:46:15.534035Z","submitted_at":"2024-03-05T18:31:28Z","title":"MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03194","snapshot_observed_at":"2026-08-16T04:22:35.244577Z","title":"Magid: An automated pipeline for generating synthetic multi-modal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.244577Z"},"links":{"cited_paper":"/paper/2403.03194","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d4abb6ec0931e8e4e9386c23e89cae6bfe1395d2c2eb5861ac680f6cffaf85b3","observation_id":"4fc7c5a0-1b2f-4459-b7de-4bf5f8d2ee71","resolution":{"observed_at":"2026-08-16T04:22:35.244577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.249630Z","title":"Using large language models to simulate multiple humans and replicate human subject studies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.249630Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:6a2444bf3d8961c0e6ea4c2b372da6986680962f22682e6a5303c7c736bc9c47","observation_id":"5e4b7867-e481-4e89-9f88-a82cbff84499","resolution":{"observed_at":"2026-08-16T04:22:35.249630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.069452Z","title":null,"venue":null,"work_id":"db111252-237e-48ad-9a18-a110c4637a5f","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.253077Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:bd715997cf8f1d8d3af92c7ebe6195ee2aa42f561a81b5fb39627c2f12957865","observation_id":"054c840f-be69-4fc8-8ccf-7aa6f87bcfec","resolution":{"observed_at":"2026-08-16T04:22:36.072812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.256646Z","title":"Out of one, many: Using language models to simulate human samples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.256646Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:18e494d531bdf915cc531da9f89c8e3c16be57c91bf4fe77c483f039f7697364","observation_id":"eea1f544-53ba-405a-8c22-11cd67f982cc","resolution":{"observed_at":"2026-08-16T04:22:35.256646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.052568Z","title":"Multi-modal embeddings for isolating cross-platform coordinated information campaigns on social media","venue":null,"work_id":"2d01383d-a8ca-4224-9418-e8d46c2b4f2e","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.260861Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:859dd4d5f0369ae228d2c03a353b375a7de9ef71e3c1f71abe8b1326a70bf042","observation_id":"1e62898e-69b8-495b-bda7-3b0d021534e8","resolution":{"observed_at":"2026-08-16T04:22:36.055998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12421","last_updated":"2020-10-26T09:14:54Z","snapshot_observed_at":"2026-08-16T19:11:09.547679Z","submitted_at":"2020-10-23T14:11:04Z","title":"TweetEval: Unified Benchmark and Comparative Evaluation for Tweet Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12421","snapshot_observed_at":"2026-08-16T04:22:35.264830Z","title":"Tweet- eval: Unified benchmark and comparative evaluation for tweet classification","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.264830Z"},"links":{"cited_paper":"/paper/2010.12421","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b58d5397f0234c42ca0148f19d9b9b1e115d95be154b95d49cff01044481020a","observation_id":"3c4bc4dc-f5f6-435a-a417-a26766862ed3","resolution":{"observed_at":"2026-08-16T04:22:35.264830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15214","last_updated":"2024-03-22T13:58:42Z","snapshot_observed_at":"2026-08-17T04:35:02.301388Z","submitted_at":"2024-03-22T13:58:42Z","title":"InstaSynth: Opportunities and Challenges in Generating Synthetic Instagram Data with ChatGPT for Sponsored Content Detection","version":1},"cited_work":{"arxiv_id":"2403.15214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.15214","snapshot_observed_at":"2026-08-16T04:22:35.704569Z","title":"InstaSynth: Opportunities and Challenges in Generating Synthetic Instagram Data with ChatGPT for Sponsored Content Detection","venue":"cs.CY","work_id":"4bef62db-afa3-43bc-9200-cfa294443ea2","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.270587Z"},"links":{"cited_paper":"/paper/2403.15214","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:8b5c1c9f5616096836337ab5a9c67089ef4b60768780e3f24a1768c6147a7919","observation_id":"768249a7-258c-4d02-84a9-ad4b45755774","resolution":{"observed_at":"2026-08-16T04:22:35.709115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.041823Z","title":"Leveraging llm-generated data for detecting depression symptoms on social media","venue":null,"work_id":"fe980bdf-334d-4d63-9753-729b79518b72","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.274968Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:440534d1476d3f18c30083c7025aa38d0c995f091b4e6db6301760beb1879789","observation_id":"a263d66a-92dd-46d3-bcf5-a5cfdf84b6fe","resolution":{"observed_at":"2026-08-16T04:22:36.045479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-08-16T15:52:48.033754Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-16T04:22:35.278689Z","title":"Auggpt: Leveraging chatgpt for text data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.278689Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:4df82747fae34706b1ffa260de35716e7339302df1c5655cead2e05d3f29b96b","observation_id":"654b2a5e-eabf-40fc-943a-49af9cac24b3","resolution":{"observed_at":"2026-08-16T04:22:35.278689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02472","last_updated":"2024-12-15T03:56:04Z","snapshot_observed_at":"2026-08-16T14:12:53.258848Z","submitted_at":"2024-03-04T20:34:58Z","title":"OffensiveLang: A Community Based Implicit Offensive Language Dataset","version":8},"cited_work":{"arxiv_id":"2403.02472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02472","snapshot_observed_at":"2026-08-16T04:22:35.675861Z","title":"OffensiveLang: A Community Based Implicit Offensive Language Dataset","venue":"cs.CL","work_id":"85121493-503f-4557-a968-ce3fc8bd23fa","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.282944Z"},"links":{"cited_paper":"/paper/2403.02472","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:a89e41c9617186ea927fd4152c872a9298f1ec33a473ece1e50a006af0be10f6","observation_id":"3a22e7c8-e326-4965-85e1-0a564f513935","resolution":{"observed_at":"2026-08-16T04:22:35.680879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.031689Z","title":"Identify- ing citizen-related issues from social media using llm-based data augmentation","venue":null,"work_id":"7f249e21-f5b7-48d3-9042-440677a0d4c7","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.288243Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:517f6bba987b9bf9f52e55dc4026cddf1a44dad8c3b8f1a63c0a0bab7424e8aa","observation_id":"26380adf-dcd9-4714-aaf6-f1863a83adba","resolution":{"observed_at":"2026-08-16T04:22:36.035326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.020476Z","title":"emojinal intelligence","venue":null,"work_id":"29cd92d3-df0d-4e05-96e7-8f37b486d00d","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.292394Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:a1c1fcaab8675273d78c40dc6056299367d6c9e2c1df1cf750eeb39529ba4449","observation_id":"cb9aa1a1-e22c-4aae-9409-d08b658011d2","resolution":{"observed_at":"2026-08-16T04:22:36.025142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.010679Z","title":"Socially aware synthetic data generation for suicidal ideation detection using large language models","venue":null,"work_id":"245c0d75-2548-4d4f-968f-c7f3288748d0","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.295998Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:845374fde69f349859941e9af250a3db16537305374da0021cedc7580890143f","observation_id":"3106ebe8-50b3-47dd-838e-7e7439f1e93a","resolution":{"observed_at":"2026-08-16T04:22:36.014412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-16T04:22:35.299997Z","title":"Bertopic: Neural topic modeling with a class-based tf-idf procedure","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.299997Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:62085d2118218ff071357f65bc57d844acabf6907150d857551d6d12983e8a11","observation_id":"bc45ae40-483f-455a-8f96-9a1cfa448992","resolution":{"observed_at":"2026-08-16T04:22:35.299997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:36.000579Z","title":"Ai and the transformation of social science research","venue":null,"work_id":"1da5f82b-169d-46a0-a220-2bdd0346e9da","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.304111Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:f237d359824b21b928c91e377615aa76cbfdcfe8b4a022b61a32f36fa990424f","observation_id":"5641f42c-4d58-43dd-ab9b-671646c2cb17","resolution":{"observed_at":"2026-08-16T04:22:36.004225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.989818Z","title":"Across platforms and languages: Dutch influencers and legal disclosures on instagram, youtube and tiktok","venue":null,"work_id":"d72d5113-2f9a-4586-a443-fc76687b94c4","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.307798Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:20384f7460a795523dd8c09d9d4952b2432c9bd5ca7d759f8c4fbbeb75de9c35","observation_id":"f54d3f0d-19bb-4032-b507-5ee92aa251d9","resolution":{"observed_at":"2026-08-16T04:22:35.993594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.978722Z","title":"Evaluating large language models in generating synthetic hci research data: a case study","venue":null,"work_id":"524affc4-4bff-4ff2-9d2f-299d9f634555","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.311486Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:2b37198180f7227e847e27a166720dc0f60d5972cf29392e3112012d0b7360d0","observation_id":"15196dc5-f0fd-4903-9a05-13752a68cae2","resolution":{"observed_at":"2026-08-16T04:22:35.982498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.968071Z","title":"Happenstance: utilizing semantic search to track russian state media narratives about the russo-ukrainian war on reddit","venue":null,"work_id":"8b7893b6-7149-4988-9464-11234154fb98","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.315065Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:bad6e6710e1fb56094640c239fada6525db084c7a5fd7144db4018c918d0feca","observation_id":"d78ce1c5-8d64-4de2-bca4-7736918d897e","resolution":{"observed_at":"2026-08-16T04:22:35.971825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-16T17:13:42.482483Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-16T04:22:35.318754Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.318754Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:a757f8b810b4c9160c0e6c71c522f0cdb01f75d1392736e57e047d73c9cc9afb","observation_id":"227b5f57-ed15-4c60-95e1-1f7f57f5b730","resolution":{"observed_at":"2026-08-16T04:22:35.318754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.957282Z","title":"Using twitter data to understand public perceptions of approved versus off-label use for covid-19-related medications","venue":null,"work_id":"606c36e0-0748-41c7-a972-2f8b8852e08e","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.322990Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:011161e405eca16b8f8d2e739beffe512851c2437456dab9d12f6381226d3411","observation_id":"5f7941c4-f54b-4caa-a349-9ff0255cc354","resolution":{"observed_at":"2026-08-16T04:22:35.961182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12933","last_updated":"2024-06-19T03:27:43Z","snapshot_observed_at":"2026-08-17T09:31:10.591297Z","submitted_at":"2024-04-19T15:04:30Z","title":"Cross-cultural Inspiration Detection and Analysis in Real and LLM-generated Social Media Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12933","snapshot_observed_at":"2026-08-16T04:22:35.326772Z","title":"Cross-cultural inspiration detec- tion and analysis in real and llm-generated social media data.arXiv preprint arXiv:2404.12933, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.326772Z"},"links":{"cited_paper":"/paper/2404.12933","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:239afb27503ac1f8000aff6450356e4971cbede455a7a40de65802d06a2b1887","observation_id":"1f3e654b-a68b-456a-86c0-e8ca0351d736","resolution":{"observed_at":"2026-08-16T04:22:35.326772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.946160Z","title":"Employing large language models in survey research","venue":null,"work_id":"b6cc1334-bbf0-4846-bc66-3b3cfdd4a297","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.330269Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:2a6dc52902b26c15bf32fce7f86ed4f63cc8abd30151a4bac02aa74aacd74164","observation_id":"d1902fe4-7862-490a-9e63-475f39da556e","resolution":{"observed_at":"2026-08-16T04:22:35.950085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04132","last_updated":"2023-10-29T14:24:46Z","snapshot_observed_at":"2026-08-17T04:43:53.297751Z","submitted_at":"2023-03-07T18:48:55Z","title":"Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04132","snapshot_observed_at":"2026-08-16T04:22:35.333520Z","title":"Exploiting asymmetry for synthetic training data generation: Synthie and the case of information extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.333520Z"},"links":{"cited_paper":"/paper/2303.04132","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:e6bab393e4e9d4ca2fb3cbb6488fbd4e12fea074d884fa81d3d0c766da3d99b1","observation_id":"cc9eede0-4274-4830-a4da-b5a314accafb","resolution":{"observed_at":"2026-08-16T04:22:35.333520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15860","last_updated":"2025-08-20T21:36:23Z","snapshot_observed_at":"2026-08-16T12:56:23.672726Z","submitted_at":"2025-02-21T10:17:29Z","title":"Synthetic vs. Gold: The Role of LLM Generated Labels and Data in Cyberbullying Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15860","snapshot_observed_at":"2026-08-16T04:22:35.337457Z","title":"Synthetic vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.337457Z"},"links":{"cited_paper":"/paper/2502.15860","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:a608b6114307830f040ec22362ed768bc5588691f452993ad0a5d7cb6262e2f4","observation_id":"a9eb81f6-7b20-4b7d-82ec-011ecbdb59f0","resolution":{"observed_at":"2026-08-16T04:22:35.337457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.934532Z","title":null,"venue":null,"work_id":"3dd761fb-be42-46fe-8c48-f4fe854f180c","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.341112Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:7b511e1688bded9d50ce05457606f71c744b95aa2ce831a6166f08f2de010004","observation_id":"2464694f-65d0-4b0e-b306-3c70f9a03c2c","resolution":{"observed_at":"2026-08-16T04:22:35.938619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.344988Z","title":"Data augmentation approaches in natural language processing: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.344988Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:374ddc360730a14e93465ec4c3dd6747c3bd5c4c12aa3584039d9a01e69a7d36","observation_id":"9a17df87-7095-4099-b6fc-6ee42100f7b7","resolution":{"observed_at":"2026-08-16T04:22:35.344988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.917289Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations","venue":null,"work_id":"d20d2cdf-5ca3-427c-b86d-73c7a300cf73","year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.348514Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b8e79a69c6fcacac653bf96ca808322471306161b905cc7e0e91d178dfab63e1","observation_id":"7a2345b8-b3f9-40af-90ab-3ec4e34af8a1","resolution":{"observed_at":"2026-08-16T04:22:35.921358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.352074Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.352074Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:131866fe91965b2b8422004cab371e307fafae406185bd4bccdd8e7afaab7a48","observation_id":"407ac7c7-d9d9-4813-ab4c-960c8c9614b2","resolution":{"observed_at":"2026-08-16T04:22:35.352074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T04:22:35.355526Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.355526Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:697ff611dfd066d908e1081686258e6ff91da56a99e16a7f93caeefb2485a8c9","observation_id":"8a63c60d-be2e-4dd0-bd64-957ad5b90515","resolution":{"observed_at":"2026-08-16T04:22:35.355526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.899241Z","title":"TimeLMs: Diachronic language models from Twitter","venue":null,"work_id":"65e92eea-e971-4901-95b0-8653327cb81a","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.359865Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:44945261be4d280b0f76e2ac53f60af659abd89ffe6945d8f5c39520c0917d7a","observation_id":"f2e6586c-5d02-4b5a-932e-d8aec8ba6e8b","resolution":{"observed_at":"2026-08-16T04:22:35.903099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.888992Z","title":"Coordinating a multi-platform disinformation campaign: Internet research agency activity on three u.s","venue":null,"work_id":"4e726be8-d978-4bfb-a677-a5c97fccd686","year":2015},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.363562Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:1bb4d57071620cfc1b808d7401eb8831d6cbc6d4ea8d0d60f5a75edeb74eaafb","observation_id":"0a1c1f84-8d3f-4534-9dbc-aadd6e5c6ac6","resolution":{"observed_at":"2026-08-16T04:22:35.892748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.878524Z","title":null,"venue":null,"work_id":"8d97f39b-de37-40ff-a276-9496acea967d","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.367294Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:b9bcc809ef0596846e67abfbae53281659fad2f3762526f08073a7c503934e8b","observation_id":"4c6d5e05-5670-459a-95a3-dab426d27aa7","resolution":{"observed_at":"2026-08-16T04:22:35.882135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13861","last_updated":"2024-02-05T14:41:35Z","snapshot_observed_at":"2026-08-16T15:37:24.924101Z","submitted_at":"2023-04-26T23:09:02Z","title":"The Parrot Dilemma: Human-Labeled vs. LLM-augmented Data in Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13861","snapshot_observed_at":"2026-08-16T04:22:35.370884Z","title":"Is a prompt and a few samples all you need? using gpt-4 for data augmentation in low-resource classification tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.370884Z"},"links":{"cited_paper":"/paper/2304.13861","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:9f55213a5fe6a5b95ad4c9d8459fd2152033ddc940491550304691dba3b6ba11","observation_id":"fa490eaf-475e-4eb2-a77f-ff97c0bb9d5e","resolution":{"observed_at":"2026-08-16T04:22:35.370884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10005","last_updated":"2022-01-24T23:36:20Z","snapshot_observed_at":"2026-07-06T12:30:51.934079Z","submitted_at":"2022-01-24T23:36:20Z","title":"Text and Code Embeddings by Contrastive Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10005","snapshot_observed_at":"2026-08-16T04:22:35.374703Z","title":"Text and code embeddings by contrastive pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.374703Z"},"links":{"cited_paper":"/paper/2201.10005","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d1e6a7b158d14946b68f264ebad34070387800539330e2b892088773262eb5a4","observation_id":"32951e68-9044-442a-bd57-4d4ef9c90d79","resolution":{"observed_at":"2026-08-16T04:22:35.374703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.866722Z","title":"Multi-platform information operations: Twitter, facebook and youtube against the white helmets","venue":null,"work_id":"612c2208-016d-4008-828c-f27f4b8c89b7","year":2021},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.378714Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:5c87447cfbf088cc1e26c4d5f7f3d5360829ae519d950a420e3eb40cfb772c8f","observation_id":"8f60f855-647b-4e45-b61d-a690568626e6","resolution":{"observed_at":"2026-08-16T04:22:35.870726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06281","last_updated":"2024-01-03T12:20:35Z","snapshot_observed_at":"2026-08-16T14:35:56.165307Z","submitted_at":"2023-12-11T10:35:32Z","title":"EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06281","snapshot_observed_at":"2026-08-16T04:22:35.382932Z","title":"Eq-bench: An emotional intelligence benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.382932Z"},"links":{"cited_paper":"/paper/2312.06281","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:6bc397f65b1a6021d554ba41c331a6f0d91eb80820fa4f68072633115bb5ed6d","observation_id":"49a246c2-69ef-4543-aae2-67b16f3f2b4c","resolution":{"observed_at":"2026-08-16T04:22:35.382932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.855873Z","title":"Enhancing discourse parsing for local structures from social media with llm-generated data","venue":null,"work_id":"70f47040-0bd3-4206-9afe-979f5da5add5","year":2025},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.386969Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:617a7755d244ae4e21dc8dc55290bd83797160a875fa6e58b53b2c92d5279720","observation_id":"48b8b881-8d29-4fb5-8b1e-f39505ba666b","resolution":{"observed_at":"2026-08-16T04:22:35.860167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.845511Z","title":"Ita-election-2022: A multi-platform dataset of social media conversations around the 2022 italian general election","venue":null,"work_id":"efac0af6-979f-4031-98fc-612242e5ffc1","year":2022},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.390593Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:ce942fcd8122ad3991c52d8668b808229fd2e30ea57bc32a115c6f4d007a34de","observation_id":"1c11d7a5-ab71-4c58-8bf3-503c7aab5e7f","resolution":{"observed_at":"2026-08-16T04:22:35.849167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.835135Z","title":"Llm-based synthetic datasets: Applications and limitations in toxicity detection","venue":null,"work_id":"c3e422c0-d642-4396-ace8-960d0b008aca","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.394815Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:874db8c6cbd1341755a2b04c86d368d06e7d3639952925729c9870eef72353e2","observation_id":"3449ecc6-328b-4a48-9e75-86d755098867","resolution":{"observed_at":"2026-08-16T04:22:35.838889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.822974Z","title":"Computational repro- ducibility in computational social science","venue":null,"work_id":"2eee0459-3146-40e9-93fb-0aa8184ef298","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.398541Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:edd68b0902aaefab2e8b77179fcfbbf0403e55154bd53cef3d51ddfa7b2a5c51","observation_id":"22f2ddcb-5340-4b32-832c-2d507f93336e","resolution":{"observed_at":"2026-08-16T04:22:35.827107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06709","last_updated":"2016-06-03T15:09:54Z","snapshot_observed_at":"2026-08-14T22:21:59.885585Z","submitted_at":"2015-11-20T17:58:37Z","title":"Improving Neural Machine Translation Models with Monolingual Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06709","snapshot_observed_at":"2026-08-16T04:22:35.402129Z","title":"Improving neural machine translation models with monolingual data","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.402129Z"},"links":{"cited_paper":"/paper/1511.06709","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:7f07342b81235a5bc36d2d45fad59280a4b9b887f47cadc33e0364ebb4ed2bde","observation_id":"8cfdd11a-0378-40c3-9ac7-6ed8fc873276","resolution":{"observed_at":"2026-08-16T04:22:35.402129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.811453Z","title":"The rise of germany’s afd: A social media analysis","venue":null,"work_id":"6cf85b9c-aa1d-4042-ab1c-55b65d464fe7","year":2019},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.406349Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:07399cd014860abb24f811409bd80f629255c7a6c881e6c3cfe54def888117f8","observation_id":"581c3275-5946-4627-bfe4-0d31d354dbe6","resolution":{"observed_at":"2026-08-16T04:22:35.815312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08323","last_updated":"2024-07-11T09:12:39Z","snapshot_observed_at":"2026-08-17T09:13:10.513475Z","submitted_at":"2024-07-11T09:12:39Z","title":"Leveraging GPT for the Generation of Multi-Platform Social Media Datasets for Research","version":1},"cited_work":{"arxiv_id":"2407.08323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08323","snapshot_observed_at":"2026-08-16T04:22:35.547441Z","title":"Leveraging GPT for the Generation of Multi-Platform Social Media Datasets for Research","venue":"cs.CY","work_id":"8beb143e-dae0-4ac5-adbd-8be5dabc5a4e","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.409736Z"},"links":{"cited_paper":"/paper/2407.08323","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:59f2fc21cf3948e6e8975afaea0632baba5b18c9404b4753f7924c6025f3d9dd","observation_id":"3aa5478b-6483-432b-9ff2-e4aaed311e22","resolution":{"observed_at":"2026-08-16T04:22:35.554261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.799755Z","title":"Leveraging gpt for the generation of multi-platform so- cial media datasets for research","venue":null,"work_id":"ce0f0e1d-b21b-471c-8e72-7cd6580aec03","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.414755Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:65dceae95db9f46b79a904c7b799ecd215fa31533acab4f1aaacd4125c867973","observation_id":"ea1c1cdc-69b7-48a4-97bc-80904a56fb07","resolution":{"observed_at":"2026-08-16T04:22:35.803786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05984","last_updated":"2023-10-05T18:26:06Z","snapshot_observed_at":"2026-08-16T14:54:41.475056Z","submitted_at":"2023-10-05T18:26:06Z","title":"Simulating Social Media Using Large Language Models to Evaluate Alternative News Feed Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05984","snapshot_observed_at":"2026-08-16T04:22:35.418691Z","title":"Simulating social media using large language models to evaluate alternative news feed algorithms.arXiv preprint arXiv:2310.05984, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.418691Z"},"links":{"cited_paper":"/paper/2310.05984","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:7ba3e20d96550b400e3c4ca3ba46c315b785c815b3cea1bbb15d10d67516a23d","observation_id":"6114c419-44fb-41ac-a07d-d15d16a11292","resolution":{"observed_at":"2026-08-16T04:22:35.418691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.786938Z","title":"Big questions for social media big data: Representativeness, validity and other methodological pitfalls","venue":null,"work_id":"8a1de646-e7ec-45d7-af50-b0d2d12e1825","year":2014},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.423320Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:3f2b3c396baec11d433fe1c0725b87f6cb61c5c1b6e92524af125cece4345287","observation_id":"27c70c33-b534-42f0-a067-fc01be915053","resolution":{"observed_at":"2026-08-16T04:22:35.791182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14334","last_updated":"2023-04-27T17:07:29Z","snapshot_observed_at":"2026-08-16T15:37:11.642316Z","submitted_at":"2023-04-27T17:07:29Z","title":"ZeroShotDataAug: Generating and Augmenting Training Data with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14334","snapshot_observed_at":"2026-08-16T04:22:35.427235Z","title":"Zeroshotdataaug: Generating and augmenting training data with chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.427235Z"},"links":{"cited_paper":"/paper/2304.14334","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:4283c3b7acc9a5ee7620484138799bb0e5bd2884b657cb239272a0fe71f5ff71","observation_id":"875e566a-e3e5-48e1-80b5-dd1191fbf5be","resolution":{"observed_at":"2026-08-16T04:22:35.427235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.773779Z","title":"A multi-platform dataset for detect- ing cyberbullying in social media","venue":null,"work_id":"5534010b-90e1-4b2a-93d6-8007f82b4899","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.431827Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:1899d547c7e8c6870d8dfddef3ed80c86788e9054f67b16e3c3adcb2fef69a0a","observation_id":"e2cdd483-e81c-48d2-a4fd-36301665ccdb","resolution":{"observed_at":"2026-08-16T04:22:35.778463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.761509Z","title":"Happiness and sadness in adolescents’ instagram direct messaging: A neural topic modeling approach","venue":null,"work_id":"99480b16-23f9-4c1d-b954-eb7d50673361","year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.436113Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:eef357df04ce8186210037052226820bdb0febbeff61cc717a8e09572bc9ac4d","observation_id":"327c0768-c919-4201-b835-1c61963aac27","resolution":{"observed_at":"2026-08-16T04:22:35.765837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15041","last_updated":"2023-05-24T11:27:59Z","snapshot_observed_at":"2026-08-17T16:53:35.222140Z","submitted_at":"2023-05-24T11:27:59Z","title":"Generating Faithful Synthetic Data with Large Language Models: A Case Study in Computational Social Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15041","snapshot_observed_at":"2026-08-16T04:22:35.439882Z","title":"Generating faithful synthetic data with large language models: A case study in computational social science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.439882Z"},"links":{"cited_paper":"/paper/2305.15041","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:ab57e2875c48fae1084f8a543d3aa3077ec634cadbf091a7256ae18d9d501286","observation_id":"8bde78c4-a34c-4528-947f-ea9bd71b88d5","resolution":{"observed_at":"2026-08-16T04:22:35.439882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12480","last_updated":"2025-03-12T22:04:34Z","snapshot_observed_at":"2026-08-17T18:10:50.539446Z","submitted_at":"2024-06-18T10:36:21Z","title":"The Power of LLM-Generated Synthetic Data for Stance Detection in Online Political Discussions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12480","snapshot_observed_at":"2026-08-16T04:22:35.443572Z","title":"The power of llm-generated synthetic data for stance detection in online political discussions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.443572Z"},"links":{"cited_paper":"/paper/2406.12480","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:62e59a4125c27d3a829e807cc6e51e41bffc95f6eaeec7007ce59ec2ee490b7e","observation_id":"42a7abe1-bead-4303-88aa-c7ce2116e32d","resolution":{"observed_at":"2026-08-16T04:22:35.443572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.749773Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"2e7d048d-f2ad-4872-a246-4966a86808bb","year":2020},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.447817Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:cd2b53b179e8b8739ea3e31118616889ae4dadf177416fd4ad1dd6bde8b96be8","observation_id":"261ac7a1-5a35-4f25-b6bc-009521e69ea3","resolution":{"observed_at":"2026-08-16T04:22:35.753455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-14T17:23:13.764826Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-16T04:22:35.451463Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.451463Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:cb24f189026a9c345105be680d041321eb82eaea3c4d50f881c09ebc3a34ad90","observation_id":"63e8b6be-95f9-4ba6-97a0-8dea9f3756c7","resolution":{"observed_at":"2026-08-16T04:22:35.451463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:22:35.738650Z","title":"Cross-platform information operations: Mobilizing narratives & building resilience through both ’big’ & ’alt’ tech","venue":null,"work_id":"90ffb427-c1b9-45cd-9236-ae40d0c12408","year":2021},"citing_paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:22:35.455720Z"},"links":{"citing_paper":"/paper/2505.02858"},"observation_digest":"sha256:d2430e860740a982e17422ed67996ade7f0ada1c91463c0d572dceac2809688e","observation_id":"44e8c180-130d-40e9-a640-7eba4b36eaae","resolution":{"observed_at":"2026-08-16T04:22:35.742312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02858","last_updated":"2025-05-02T18:56:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T16:49:19.020220Z","submitted_at":"2025-05-02T18:56:01Z","title":"Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.02858."}